SSD Nodes Learn
गाइड Matt Connorलेखक: Matt Connor · अपडेट किया गया: 2026-07-24

कौन सा Claude model चुनें? Cost Guide

Opus 4.8, Sonnet 5 या Haiku 4.5? July 2026 की API rates और 100,000 jobs का सटीक cost comparison देखें। सही model चुनने के लिए यह guide पढ़ें।

मुझे कौन सा Claude model इस्तेमाल करना चाहिए?

आपको कौन सा Claude model इस्तेमाल करना चाहिए, इसका संक्षिप्त उत्तर यह है: Claude Opus 4.8 से शुरुआत करें, और किसी ठोस कारण के बिना इसे न बदलें। Anthropic का मार्गदर्शन भी यही है। "यदि आप अनिश्चित हैं कि किस model का उपयोग करना है, तो जटिल agentic coding और enterprise कार्य के लिए Claude Opus 4.8 से शुरुआत करें।" जब कार्य स्पष्ट रूप से परिभाषित हो और आप इसे दिन में कई बार चलाते हैं, तब Claude Sonnet 5 पर आ जाएं। यांत्रिक और high-volume कार्य के लिए, जहाँ आपको पता है कि सही उत्तर कैसा दिखता है, फिर से Claude Haiku 4.5 पर आ जाएं। Claude Fable 5, long-running agents के लिए इन सभी से ऊपर है।

इस चुनाव की एक कीमत है। 23 July 2026 तक Claude API (application programming interface) की दरें प्रति मिलियन tokens (जिसे docs में MTok लिखा गया है) इस प्रकार हैं:

  • Claude Fable 5 (claude-fable-5): $10 / MTok in, $50 / MTok out. 1M context.
  • Claude Opus 4.8 (claude-opus-4-8): $5 in, $25 out. 1M context.
  • Claude Opus 4.7 (claude-opus-4-7): $5 in, $25 out. 1M context.
  • Claude Sonnet 5 (claude-sonnet-5): 31 August 2026 तक introductory pricing पर $2 in, $10 out। 1 September 2026 से मानक $3 in, $15 out प्रभावी होगा। 1M context.
  • Claude Haiku 4.5 (claude-haiku-4-5): $1 in, $5 out. 200K context.

ये identifiers लिखे अनुसार ही पूर्ण हैं। इनके साथ कुछ भी जोड़ा नहीं जाता है।

1M-token models पर आकार (size) के लिए कोई अतिरिक्त शुल्क नहीं है: "900k-token request के लिए वही per-token rate लिया जाता है जो 9k-token request के लिए लिया जाता है।"

प्रत्येक model का वास्तविक उपयोग

Anthropic प्रत्येक model के लिए एक पंक्ति का विवरण देता है। ये विवरण किसी भी leaderboard से बेहतर मार्गदर्शन करते हैं।

  • Claude Fable 5: "long-running agents के लिए next-generation intelligence।" latency के मामले में चारों में सबसे धीमा।
  • Claude Opus 4.8: "complex agentic coding और enterprise work के लिए।" moderate latency।
  • Claude Sonnet 5: "speed और intelligence का सबसे अच्छा संयोजन।" fast।
  • Claude Haiku 4.5: "near-frontier intelligence वाला सबसे fast model।"

Haiku 4.5 की कुछ सीमाएँ (limits) भी हैं, जो कीमत से पहले कार्य की उपयुक्तता तय करती हैं। इसका context window 1M के बजाय 200K tokens है, इसलिए एक बड़ा repository या लंबा agent transcript इसमें नहीं आ पाएगा। synchronous Messages API पर इसका maximum output 64K tokens है, जबकि अन्य के लिए यह 128K है। इसकी reliable knowledge cutoff February 2025 है, जबकि अन्य तीनों की January 2026 है।

वास्तविक workload पर इस चुनाव की लागत क्या होगी?

इस lineup में प्रत्येक model का output rate, input rate से पांच गुना है। Opus 4.8 के लिए $5 input और $25 output है। Haiku 4.5 के लिए $1 input और $5 output है। यह ratio पूरी range में समान रहता है, इसलिए अधिक output वाले कार्यों के लिए आपके द्वारा चुना गया model सबसे महत्वपूर्ण होता है।

Agentic work इस प्रकार का कार्य है, क्योंकि thinking tokens को output tokens के रूप में बिल किया जाता है और वे max_tokens में गिने जाते हैं, भले ही text आप तक न पहुँचे। Fable 5, Opus 4.8, Opus 4.7 और Sonnet 5 पर reasoning summary default रूप से हटा दी जाती है, इसलिए thinking field खाली आता है। Billing अपरिवर्तित रहती है: "दोनों ही स्थितियों में block का billing समान रहता है और multi-turn conversations में इसे समान रूप से वापस भेजा जाता है।" Claude token bill वास्तव में क्या भरता है इसका विस्तार से विश्लेषण करता है।

Thinking का चलना या न चलना आपके द्वारा तुलना किए जा रहे models के बीच भिन्न होता है, जिसे अनदेखा करने पर cost test गलत हो सकता है। Sonnet 5 और Fable 5 पर thinking पहले से ही on है और इसे किसी configuration की आवश्यकता नहीं है। Opus 4.8 और Opus 4.7 पर यह तब तक off रहता है जब तक आप request में thinking: {type: "adaptive"} सेट नहीं करते। आंकड़ों का विश्लेषण करने से पहले दोनों तरफ configuration को समान रखें।

Sabse sasta model sabse mehnga kyun ho sakta hai

Ek self-contained coding task lijiye. Request mein 60,000 tokens ka context hai, aur model thinking ke saath 8,000 tokens ka output deta hai. Caching ka upyog nahi ho raha hai, isliye saari calculation dikhayi gayi hai.

Opus 4.8 par: $5 ki dar par 0.06 MTok input ka kharcha $0.30 hai, aur $25 ki dar par 0.008 MTok output ka kharcha $0.20 hai. Ek attempt ki kul laagat $0.50 hai. Haiku 4.5 par wahi attempt $0.06 plus $0.04, yani $0.10 hai.

Haiku har attempt ke liye paanch guna sasta hai. Yeh bahut badi bachat lagti hai, lekin ek failed attempt ke nateejon ko dekhne ke baad aisa nahi lagta. Galat answer padhne mein aapka samay kharch hota hai. Retry karte samay aap use context ke roop mein phir se bhejte hain, isliye har naya attempt pichle wale se bada hota hai. Jab teesra attempt bhi fail ho jata hai, tab aap Opus ka upyog karte hain: $0.30 Haiku plus $0.50 Opus milkar $0.80 ho jate hain, jo ki Opus ko ek baar chalane se 60% zyada hai.

Isliye mukhya sawal yeh hai ki aap answer ko kitni sasti tarike se check kar sakte hain. Jab galat answer ek second mein saaf dikh jaye, toh chhota model faydemand hai. Lekin agar error pakadne ke liye diff ko dhyan se padhna pade, toh chhota model aapka samay kharch karta hai, jo invoice mein nahi dikhta.

जहाँ छोटा मॉडल पूरी तरह से बेहतर है

इन मामलों में Haiku 4.5 सही विकल्प है:

  • Mechanical subagent कार्य। एक subagent जो files का नाम बदलता है या search output इकट्ठा करता है, उसे frontier reasoning की आवश्यकता नहीं होती। जब आप Claude के साथ AI agent बनाते हैं और उसे helpers देते हैं, तो यह एक standard pattern बन जाता है।
  • Log triage। यह तय करना कि कोई line noise है या उस पर human attention की आवश्यकता है, एक narrow judgement है जिसमें failure mode स्पष्ट होता है।
  • Fixed label set के विरुद्ध classification। Output छोटा होता है और sample पर accuracy को मापा जा सकता है।
  • High-volume production calls। 100,000 runs प्रति दिन होने पर, per-token अंतर अब मामूली नहीं रह जाता। n8n में जुड़े AI workflows का स्वरूप आमतौर पर ऐसा ही होता है।
  • ऐसी कोई भी चीज़ जहाँ user के लिए response speed महत्वपूर्ण है। Haiku 4.5 इस lineup में सबसे तेज़ model है।

एक सीमा विशेष रूप से Haiku से संबंधित है। Opus 4.8 और Sonnet 5 पर 1,024 tokens के मुकाबले, Haiku का minimum cacheable prompt 4,096 tokens है। इस minimum से कम होने पर "any requests to cache fewer than this number of tokens will be processed without caching, and no error is returned"। Sonnet 5 पर cache होने वाला 1,500-token instruction block, Haiku 4.5 पर silently cache नहीं होता है। इसकी पहचान cache_creation_input_tokens और cache_read_input_tokens का zero पर होना है, जो always-on agent की costs कम रखने के अन्य तरीकों के साथ-साथ cache न होने का एक कारण है।

वे कारक जो उत्तर को बदलते हैं

इनमें से प्रत्येक कारक मॉडल के नाम की तुलना में परिणाम को अधिक प्रभावित करता है।

Effort. output_config.effort यह नियंत्रित करता है कि मॉडल उत्तर देने से पहले कितना कार्य करता है। इसके स्तर low, medium, high, xhigh और max हैं, और high डिफॉल्ट है: "effort को high पर सेट करने से बिल्कुल वैसा ही व्यवहार मिलता है जैसा effort पैरामीटर को पूरी तरह से हटाने पर मिलता है।" यह अनुरोध के टॉप लेवल के बजाय output_config के अंदर आता है:

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    messages=messages,
)

Effort रिस्पॉन्स के हर टोकन को प्रभावित करता है: "यह टूल कॉल्स सहित सभी टोकन खर्च को प्रभावित कर सकता है। उदाहरण के लिए, कम effort का मतलब है कि Claude कम टूल कॉल्स करेगा।" यह एक agentic loop में प्रभाव को बढ़ा देता है। यह टोकन कैप नहीं है: "Effort एक व्यवहारिक संकेत है, न कि कोई सख्त टोकन बजट।" Anthropic प्रत्येक स्तर के लिए कोई लागत गुणक (cost multiplier) प्रकाशित नहीं करता है और आपको अपने स्वयं के उपयोग के मामले का परीक्षण करने की सलाह देता है। इसलिए, high पर Sonnet 5 का एक रन बनाम low पर Opus 4.8 का एक रन एक वास्तविक तुलना है जिसे आप आज दोपहर कर सकते हैं। Haiku 4.5 उन मॉडलों की सूची में शामिल नहीं है जो effort को सपोर्ट करते हैं।

Prompt caching. कैश रीड (cache read) की लागत बेस इनपुट रेट की 0.1x होती है, और मॉडल के चयन का निर्णय इस आधार पर होता है कि विभिन्न tiers में यह क्या परिणाम देता है। Opus 4.8 पर एक cache hit की लागत $0.50 / MTok है, और Haiku 4.5 पर uncached इनपुट की लागत $1 / MTok है। इसलिए, एक अच्छी तरह से cached Opus prefix, एक cold Haiku prompt की तुलना में प्रति इनपुट टोकन सस्ता होता है। Session hygiene उस किसी भी वर्कलोड पर मॉडल के चुनाव से बेहतर है जो एक बड़े स्थिर prefix को बार-बार भेजता है।

Batches. यदि उत्तर के लिए किसी को प्रतीक्षा नहीं करनी है, तो Message Batches API "इनपुट और आउटपुट दोनों टोकन पर 50% की छूट" के साथ समान मॉडल चलाता है। यह नीचे दी गई तुलना की प्रत्येक पंक्ति को आधा कर देता है, और यह सभी tiers में काम करता है: 1 September 2026 से, एक batched Opus 4.8 जॉब की लागत मानक मूल्य पर एक synchronous Sonnet 5 जॉब से कम है, जो समान राशि में latency के बदले capability प्रदान करता है।

एक कार्य के लिए लागत तुलना

Workload: 100,000 support emails को classify करना। प्रत्येक call के लिए 2,000 input tokens और 300 output tokens का उपयोग करें। इसका अर्थ है 200 MTok input और 30 MTok output।

  • Haiku 4.5: 200 x $1 = $200 in, 30 x $5 = $150 out. Total $350.
  • Sonnet 5, introductory rate: 200 x $2 = $400 in, 30 x $10 = $300 out. Total $700.
  • Sonnet 5, 1 September 2026 से: 200 x $3 = $600 in, 30 x $15 = $450 out. Total $1,050.
  • Opus 4.8: 200 x $5 = $1,000 in, 30 x $25 = $750 out. Total $1,750.

कल की कीमतों के साथ गणना करने के लिए चार numbers बदलें। नीचे दिए गए adjustments परिणाम को model name की तुलना में अधिक प्रभावित करते हैं:

  • Batching हर line को आधा कर देता है: $175, $350, $525 और $875। nightly classification run में कोई प्रतीक्षा नहीं होती है, इसलिए इसे छोड़ने का कोई कारण नहीं है।
  • Shared prefix को cache करना। मान लीजिए कि 2,000 input tokens में से 1,200 tokens हर बार एक ही instruction block हैं। Sonnet 5 (introductory rate) पर, cache hits के रूप में इनकी लागत $2 / MTok के बजाय $0.20 / MTok होगी। इस प्रकार 120 MTok की लागत $240 के बजाय $24 होगी। इसमें $2 की दर से 80 MTok fresh input ($160) और $300 output जोड़ें। Sonnet 5 की कुल लागत $700 के बजाय लगभग $484 होगी। Haiku 4.5 पर यह trick काम नहीं करती, क्योंकि 1,200 tokens इसके 4,096-token minimum से कम हैं।
  • Retries. मान लीजिए कि आप 8% emails पर Haiku के उत्तर को reject करते हैं और उन्हें Opus 4.8 पर re-run करते हैं। $350 में (0.08 x $1,750 = $140) जोड़ें, जिससे $490 प्राप्त होगा। मेरी दर के बजाय अपनी rejection rate मापें।
  • Tool definitions, यदि job इनका उपयोग करती है। यदि tool_choice को auto पर सेट किया जाए, तो Opus 4.8 पर उनके द्वारा generate किया गया system prompt 290 tokens का होता है, Sonnet 5 पर 354 और Haiku 4.5 पर 496 tokens का होता है। सबसे सस्ते model में सबसे अधिक fixed overhead होता है।

$490 के साथ escalation path वाला Haiku और $484 पर cached Sonnet 5 की लागत समान है, और उनमें से एक कार्य को single pass में पूरा करता है। Model कभी भी पूरा प्रश्न नहीं था।

क्या session के बीच में model बदलना पैसे बचाता है?

यह sticker prices की तुलना में कम होता है, क्योंकि बचत per token पर होती है और आप एक पूरा cached prefix दांव पर लगा देते हैं।

Anthropic यह बताता है कि cache को क्या invalid कर देता है। Prefixes का निर्माण tools, फिर system, और फिर messages के क्रम में होता है, और "प्रत्येक level पर होने वाले बदलाव उस level और उसके बाद के सभी levels को invalid कर देते हैं।" दो request settings भी इस list में शामिल हैं: "thinking configuration और resolved effort level को prompt के अंदर ही render किया जाता है, इसलिए इनमें से किसी को भी बदलने पर एक नया cache prefix शुरू हो जाता है।" Docs में effort के बारे में और विस्तार से बताया गया है: "cache hits पर निर्भर रहने वाली conversation के भीतर के बजाय, workloads के बीच effort बदलें।"

Model इस documented list में नहीं है, इसलिए किसी भी निष्कर्ष पर न पहुँचें। switch के बाद पहले request पर cache_read_input_tokens पढ़ें और संख्या से उत्तर प्राप्त करें। 150,000-token Opus 4.8 prefix पर, cache read की लागत लगभग $0.08 है और fresh write की लागत लगभग $0.94 है, जो उस per-token gap से कहीं अधिक है जिसे आप कम करने की कोशिश कर रहे थे।

इसलिए, इन चीजों को tasks के बीच बदलें, एक task के अंदर नहीं। Claude Code में इसका मतलब है पहले /clear, जब cache वैसे भी discard किया जा रहा हो, फिर /model या /effort

अपने workload पर उत्तर का परीक्षण कैसे करें

किसी अन्य model के count के आधार पर prompt का size निर्धारित न करें। Token-counting endpoint का उपयोग करना निःशुल्क है। यह आपके द्वारा चुने गए model के tokenizer का उपयोग करता है, इसलिए उसी model का नाम लिखें जिसे आप call करने की योजना बना रहे हैं। Opus 4.7 और उसके बाद के version, Fable 5 और Sonnet 5 एक नए tokenizer का उपयोग करते हैं जो "समान text के लिए लगभग 30% अधिक tokens produce करता है"। इसलिए, पुराने model पर मापा गया budget नए model पर कम रहेगा, भले ही per-token rate समान हो।

इसके बाद परिणाम पढ़ें। input_tokens केवल uncached remainder है, इसलिए true prompt size उस field के साथ-साथ cache_creation_input_tokens और cache_read_input_tokens का योग है। A first Claude API app on a VPS उस measurement को चलाने के लिए सबसे छोटा और सटीक स्थान है, और which Claude plan fits your usage यह निर्णय लेने का एक अलग विषय है कि क्या आपको per token भुगतान करना है या नहीं।

FAQ

Coding के लिए सबसे अच्छा Claude model कौन सा है?

जटिल agentic coding के लिए Claude Opus 4.8 को मानक शुरुआती बिंदु माना गया है। July 2026 तक, इसकी लागत $5 प्रति million input tokens और $25 per million output है। Claude Sonnet 5 को speed और intelligence का सबसे अच्छा संयोजन माना जाता है। 31 August 2026 तक, $2 / $10 की दर से इसकी लागत आधे से भी कम है। दोनों models पर एक ही task चलाएं, thinking configuration को समान रखें, और response.usage से कुल token खर्च की तुलना करें।

क्या Claude Haiku 4.5, Sonnet 5 को replace करने के लिए पर्याप्त सस्ता है?

Per token के आधार पर, यह आसानी से संभव है: Sonnet 5 की introductory pricing $2 / $10 है, जबकि Haiku 4.5 की $1 / $5 है। 1 September 2026 से Sonnet 5 की दर $3 / $15 होगी। निर्णय limits पर निर्भर करता है। Haiku 4.5 में 1M के बजाय 200K token context window है, synchronous Messages API पर 64K maximum output है, February 2025 का reliable knowledge cutoff है, इसमें output_config.effort support नहीं है, और 4,096-token का minimum cacheable prompt है जो छोटे system prompts पर caching को disable कर देता है।

क्या session के बीच में सस्ते Claude model पर switch करने से पैसे बचते हैं?

यह उम्मीद से कम ही होता है। Anthropic के अनुसार, cache invalidators में tools, system या messages prefix में बदलाव, thinking configuration में बदलाव, और output_config.effort में बदलाव शामिल हैं। Model switch करने पर existing cache पर क्या प्रभाव पड़ता है, यह documented नहीं है; इसलिए इसे unknown मानें और उसके बाद पहले request पर cache_read_input_tokenscache_read_input_tokens पढ़ें। यह जानकारी महत्वपूर्ण है: 150,000-token Opus 4.8 prefix पर, cache read की लागत लगभग $0.08 है और fresh write की लागत लगभग $0.94 है। यह खर्च per-token बचत के कई turns से अधिक है। Claude Code में /clear के बाद, जब cache पहले से ही discard हो रहा हो, तब tasks के बीच switch करें।

output_config.effort मेरे bill को कैसे प्रभावित करता है?

यह text, tool calls और thinking में model द्वारा खर्च किए जाने वाले tokens की संख्या को बदल देता है। Lower effort से tool calls कम होते हैं, जिससे agentic loops में खर्च बढ़ जाता है क्योंकि हर tool result को बाद के turns में फिर से भेजा जाता है। इसके levels low, medium, high, xhigh और max हैं, जिसमें high default है। Anthropic प्रत्येक level के लिए कोई cost multiplier publish नहीं करता है; वे effort को token budget के बजाय एक behavioural signal मानते हैं, इसलिए अपने task पर स्वयं इसका परीक्षण करें।

Claude Batches API से कितनी बचत होती है?

Asynchronous delivery के बदले, input और output दोनों tokens पर 50% की बचत होती है। July 2026 तक, इसकी दर Opus 4.8 के लिए $2.50 in / $12.50 out, Sonnet 5 के लिए introductory pricing पर $1 / $5, और Haiku 4.5 के लिए $0.50 / $2.50 है। एक महत्वपूर्ण तुलना tiers के बीच है: 1 September 2026 से, एक batched Opus 4.8 job की लागत standard rate पर synchronous Sonnet 5 job से कम होगी। अतः batching से आप समान राशि में एक अधिक शक्तिशाली model प्राप्त कर सकते हैं।