सही Claude model कैसे चुनें? पूरी कीमत गाइड
Claude Opus 4.8, Sonnet 5 या Haiku 4.5 में से क्या चुनें? जुलाई 2026 की सटीक API दरें, 1,00,000 जॉब्स का लागत विश्लेषण और बिल घटाने के लिए जरूरी सेटिंग्स यहाँ विस्तार से जानें।
आपको कौन सा Claude model इस्तेमाल करना चाहिए?
आपको कौन सा Claude model इस्तेमाल करना चाहिए, इसका संक्षिप्त उत्तर यह है: Claude Opus 4.8 से शुरुआत करें, और इसे तभी बदलें जब आपके पास ऐसा करने का कोई ठोस कारण हो। Anthropic का मार्गदर्शन भी यही है। "यदि आप अनिश्चित हैं कि किस model का उपयोग करना है, तो जटिल agentic कोडिंग और एंटरप्राइज़ कार्यों के लिए Claude Opus 4.8 से शुरुआत करें।" जब कार्य अच्छी तरह से परिभाषित हो और आप उसे दिन में कई बार चलाते हों, तो Claude Sonnet 5 पर आ जाएं। यांत्रिक, उच्च-मात्रा वाले कार्यों के लिए, जहाँ आप पहले से जानते हैं कि सही उत्तर कैसा दिखता है, Claude Haiku 4.5 पर आ जाएं। लंबे समय तक चलने वाले एजेंट्स के लिए Claude Fable 5 इन सबसे ऊपर है।
इस चयन की एक कीमत है। 23 July 2026 तक Claude API (application programming interface) की दरें प्रति मिलियन टोकन (जिसे docs में MTok लिखा गया है) इस प्रकार हैं:
- Claude Fable 5 (
claude-fable-5): $10 / MTok इनपुट, $50 / MTok आउटपुट। 1M कॉन्टेक्स्ट। - Claude Opus 4.8 (
claude-opus-4-8): $5 इनपुट, $25 आउटपुट। 1M कॉन्टेक्स्ट। - Claude Opus 4.7 (
claude-opus-4-7): $5 इनपुट, $25 आउटपुट। 1M कॉन्टेक्स्ट। - Claude Sonnet 5 (
claude-sonnet-5): 31 August 2026 तक शुरुआती मूल्य निर्धारण पर $2 इनपुट, $10 आउटपुट। 1 September 2026 से मानक $3 इनपुट, $15 आउटपुट प्रभावी होगा। 1M कॉन्टेक्स्ट। - Claude Haiku 4.5 (
claude-haiku-4-5): $1 इनपुट, $5 आउटपुट। 200K कॉन्टेक्स्ट।
ये पहचानकर्ता (identifiers) लिखे अनुसार पूर्ण हैं। इनमें कुछ भी जोड़ा नहीं जाता है।
1M-token वाले models पर आकार के लिए कोई अतिरिक्त शुल्क नहीं है: "900k-token request का billing rate 9k-token request के समान per-token rate पर होता है।" ये rates केवल API तक सीमित नहीं हैं, क्योंकि Claude Enterprise API rates पर usage meter करता है और इसके ऊपर seat price भी लागू होती है। इसलिए नीचे दिया गया पूरा हिसाब seat plan वाली team के लिए भी यही रहेगा। Flat-rate subscription meter को बदलता है, लेकिन यह निर्णय नहीं बदलता, क्योंकि दोनों Claude Max tiers में वही models होते हैं और अंतर केवल मिलने वाले usage की मात्रा का होता है। इसी ladder में नीचे, Claude Pro के $20 प्रति माह में per-token rate के बजाय usage allowance मिलता है, इसलिए वहाँ आपको bill के बजाय limit reset का इंतजार करना पड़ता है। यदि आप अभी इसी स्थिति में हैं, तो यह पता लगाना कि आप किस window का इंतजार कर रहे हैं नीचे दिए गए किसी भी हिसाब से पहले आता है, क्योंकि इसका समाधान smaller model, smaller context या API पर जाना है, न कि कम rate ढूँढना। और यदि आपने अभी तक भुगतान शुरू नहीं किया है, तो सबसे पहले यह तय करना कि Pro के लिए $20 देना उचित है या नहीं इस बात पर निर्भर करता है कि free limit आपको कितनी बार रोकती है, न कि ऊपर दिए गए किसी rate पर।
प्रत्येक मॉडल का वास्तविक उद्देश्य
Anthropic प्रत्येक मॉडल के लिए एक पंक्ति में विवरण देता है, और ये पंक्तियाँ किसी भी लीडरबोर्ड से बेहतर मार्गदर्शन करती हैं।
- Claude Fable 5: "लंबे समय तक चलने वाले एजेंट्स के लिए अगली पीढ़ी की बुद्धिमत्ता।" चारों में से इसे लेटेंसी के मामले में सबसे धीमा माना गया है।
- Claude Opus 4.8: "जटिल एजेंट्स-आधारित कोडिंग और एंटरप्राइज कार्यों के लिए।" मध्यम लेटेंसी।
- Claude Sonnet 5: "गति और बुद्धिमत्ता का सर्वोत्तम संयोजन।" तेज।
- Claude Haiku 4.5: "निकट-फ्रंटियर बुद्धिमत्ता के साथ सबसे तेज मॉडल।"
Fable 5 इन चारों में से एकमात्र ऐसा मॉडल है जिसकी कीमत इस तुलना में किसी वर्कलोड पर निर्धारित नहीं की गई है, और Opus 4.8 की तुलना में दोगुनी दर पर, कौन से कार्य $10 इनपुट और $50 आउटपुट का लाभ देते हैं यह प्रश्न अपने आप में एक उत्तर की मांग करता है।
Haiku 4.5 में ऐसी सीमाएँ भी हैं जो कीमत से पहले ही यह तय कर देती हैं कि वह कार्य के लिए उपयुक्त है या नहीं। इसका कॉन्टेक्स्ट विंडो 1M के बजाय 200K टोकन है, इसलिए एक बड़ा रिपॉजिटरी या लंबा एजेंट ट्रांसक्रिप्ट इसमें फिट नहीं होगा। सिंक्रोनस Messages API पर इसका अधिकतम आउटपुट 64K टोकन है, जबकि अन्य के लिए यह 128K है, और इसका विश्वसनीय नॉलेज कटऑफ फरवरी 2025 है, जबकि अन्य तीनों का जनवरी 2026 है।
वास्तविक वर्कलोड पर इस विकल्प की क्या लागत है?
लाइनअप में प्रत्येक मॉडल आउटपुट की कीमत अपने इनपुट रेट से पांच गुना रखता है। Opus 4.8 के लिए इनपुट $5 और आउटपुट $25 है। Haiku 4.5 के लिए इनपुट $1 और आउटपुट $5 है। यह अनुपात पूरी रेंज में समान रहता है, इसलिए आप जिस मॉडल को चुनते हैं, वह उन कार्यों पर सबसे अधिक मायने रखता है जिनमें बहुत अधिक आउटपुट उत्पन्न होता है।
एजेंटिक कार्य इसी प्रकार का काम है, क्योंकि थिंकिंग टोकन्स को आउटपुट टोकन्स के रूप में बिल किया जाता है और वे max_tokens में गिने जाते हैं, भले ही वह टेक्स्ट आप तक कभी न पहुँचे। Fable 5, Opus 4.8, Opus 4.7 और Sonnet 5 पर रीजनिंग समरी को डिफ़ॉल्ट रूप से हटा दिया जाता है, इसलिए thinking फ़ील्ड खाली वापस आता है। बिलिंग में कोई बदलाव नहीं होता है: "किसी भी स्थिति में ब्लॉक को समान रूप से बिल किया जाता है और मल्टी-टर्न वार्तालापों में इसे उसी तरह वापस भेजा जाता है।" Claude टोकन बिल को वास्तव में क्या भरता है उस मीटर का पूरा विवरण देता है।
थिंकिंग प्रक्रिया चल रही है या नहीं, यह उन मॉडल्स पर निर्भर करता है जिनकी आप तुलना कर रहे हैं, और यदि आप इसे अनदेखा करते हैं तो यह लागत परीक्षण के परिणामों को खराब कर देगा। Sonnet 5 और Fable 5 पर थिंकिंग पहले से ही चालू है और इसके लिए किसी कॉन्फ़िगरेशन की आवश्यकता नहीं है। Opus 4.8 और Opus 4.7 पर यह तब तक बंद रहता है जब तक आप रिक्वेस्ट में thinking: {type: "adaptive"} सेट नहीं करते। आंकड़ों का विश्लेषण करने से पहले दोनों तरफ के कॉन्फ़िगरेशन का मिलान करें।
सबसे सस्ता मॉडल सबसे महंगा क्यों हो सकता है
एक आत्मनिर्भर कोडिंग कार्य पर विचार करें। अनुरोध में 60,000 टोकन का संदर्भ (context) शामिल है, और मॉडल 8,000 टोकन का आउटपुट देता है जिसमें थिंकिंग शामिल है। कोई कैशिंग न होने के कारण, गणना स्पष्ट रहती है।
Opus 4.8 पर: $5 पर 0.06 MTok इनपुट का मूल्य $0.30 है, और $25 पर 0.008 MTok आउटपुट का मूल्य $0.20 है। इस प्रयास की लागत $0.50 है। Haiku 4.5 पर वही प्रयास $0.06 प्लस $0.04, यानी $0.10 का है।
Haiku प्रति प्रयास पांच गुना सस्ता है, जो काफी बचत जैसा दिखता है, जब तक कि आप यह न देखें कि एक विफल प्रयास क्या करता है। आप गलत उत्तर पढ़ते हैं, जिसमें आपका समय खर्च होता है। आप इसे पुनः प्रयास (retry) में संदर्भ के रूप में भेजते हैं, इसलिए प्रत्येक प्रयास पिछले वाले से बड़ा होता है। और जब तीसरा प्रयास भी विफल रहता है, तो आप वैसे भी अपग्रेड करते हैं: Haiku का $0.30 प्लस Opus का $0.50 कुल $0.80 होता है, जो Opus को एक बार चलाने की तुलना में 60% अधिक है।
इसलिए निर्णायक प्रश्न यह है कि आप उत्तर की जांच कितनी सस्ती कर सकते हैं। जब एक गलत उत्तर एक सेकंड में स्पष्ट हो जाता है, तो छोटा मॉडल एक सौदा है। जब किसी गलती को पहचानने के लिए diff को ध्यान से पढ़ना पड़ता है, तो छोटा मॉडल आपका वह समय खर्च करता है जो कभी इनवॉइस पर नहीं दिखता। उस समय पर एक संख्या निर्धारित करना यह पता लगाने के समान गणित है कि क्या Claude Code प्लान अपनी लागत वसूल करता है, और एक बार जब आपकी अपनी प्रति घंटा दर इस योग में शामिल हो जाती है, तो सस्ता मॉडल अक्सर सस्ता दिखना बंद कर देता है।
जहाँ छोटा मॉडल पूरी तरह से बेहतर है
इन स्थितियों में Haiku 4.5 सही विकल्प है:
- मैकेनिकल सब-एजेंट का काम। एक सब-एजेंट जिसे फाइलें रीनेम करनी हों या सर्च आउटपुट इकट्ठा करना हो, उसे फ्रंटियर रीजनिंग की आवश्यकता नहीं होती। जब आप Claude के साथ AI एजेंट बनाते हैं और उसे सहायक देते हैं, तो यह मानक पैटर्न बन जाता है।
- लॉग ट्राइएज (Log triage)। यह तय करना कि कोई लाइन शोर है या उस पर मानव का ध्यान जाना चाहिए, एक सीमित निर्णय है जिसमें विफलता का स्पष्ट तरीका होता है।
- निश्चित लेबल सेट के आधार पर वर्गीकरण। आउटपुट छोटा होता है और सटीकता को सैंपल पर मापा जा सकता है।
- उच्च-वॉल्यूम प्रोडक्शन कॉल्स। प्रतिदिन 100,000 रन पर, प्रति-टोकन का अंतर केवल राउंडिंग एरर नहीं रह जाता। यह n8n में जुड़े AI वर्कफ़्लो का सामान्य स्वरूप है।
- कोई भी कार्य जहाँ उपयोगकर्ता के लिए रिस्पॉन्स स्पीड मायने रखती है। Haiku 4.5 को लाइनअप में सबसे तेज़ मॉडल माना गया है।
एक सीमा विशेष रूप से Haiku पर लागू होती है। इसका न्यूनतम कैश करने योग्य प्रॉम्प्ट 4,096 टोकन है, जबकि Opus 4.8 और Sonnet 5 पर यह 1,024 है। इस न्यूनतम सीमा से कम होने पर "इस संख्या से कम टोकन कैश करने के किसी भी अनुरोध को बिना कैशिंग के प्रोसेस किया जाएगा, और कोई एरर नहीं दिया जाएगा"। 1,500-टोकन का इंस्ट्रक्शन ब्लॉक जो Sonnet 5 पर कैश हो जाता है, वह Haiku 4.5 पर चुपचाप कैश नहीं होता। इसका संकेत यह है कि cache_creation_input_tokens और cache_read_input_tokens दोनों शून्य पर रहते हैं, जिसे हमेशा चालू रहने वाले एजेंट की लागत कम रखने के लेख में अन्य तरीकों के साथ कवर किया गया है जिनसे कैश का लाभ खो सकता है।
उत्तर को बदलने वाले कारक
इनमें से प्रत्येक कारक मॉडल के नाम की तुलना में बिल को अधिक प्रभावित करता है।
Effort. output_config.effort यह नियंत्रित करता है कि उत्तर देने से पहले मॉडल कितना कार्य करता है। इसके स्तर low, medium, high, xhigh और max हैं, और high डिफ़ॉल्ट है: "effort को high पर सेट करने का परिणाम वही होता है जो effort पैरामीटर को पूरी तरह से हटाने पर मिलता है।" यह अनुरोध के शीर्ष स्तर पर रहने के बजाय output_config के भीतर स्थित होता है:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)Effort प्रतिक्रिया के प्रत्येक टोकन को प्रभावित करता है: "यह टूल कॉल्स सहित सभी टोकन खर्च को प्रभावित कर सकता है। उदाहरण के लिए, कम effort का अर्थ है कि Claude कम टूल कॉल्स करेगा।" यह एक एजेंटिक लूप पर प्रभावी होता है। यह कोई टोकन कैप नहीं है: "Effort एक व्यवहार संबंधी संकेत है, न कि कोई सख्त टोकन बजट।" Anthropic प्रति स्तर कोई लागत गुणक (cost multiplier) प्रकाशित नहीं करता है और आपको अपने उपयोग के मामले का परीक्षण करने की सलाह देता है, इसलिए high पर Sonnet 5 का रन और low पर Opus 4.8 का रन एक वास्तविक तुलना है जिसे आप आज दोपहर कर सकते हैं। Haiku 4.5 उन मॉडलों की सूची में नहीं है जो effort का समर्थन करते हैं।
Prompt caching. एक कैश रीड की लागत बेस इनपुट दर का 0.1x होती है, और मॉडल के चयन को निर्धारित करने वाली संख्या यह है कि यह विभिन्न टियर्स (tiers) पर क्या प्रभाव डालती है। Opus 4.8 पर एक कैश हिट की लागत $0.50 / MTok है, और Haiku 4.5 पर अनकैश्ड इनपुट की लागत $1 / MTok है, इसलिए एक अच्छी तरह से कैश किया गया Opus प्रीफ़िक्स, कोल्ड Haiku प्रॉम्प्ट की तुलना में प्रति इनपुट टोकन सस्ता पड़ता है। किसी भी ऐसे वर्कलोड पर जहाँ एक बड़ा स्थिर प्रीफ़िक्स बार-बार भेजा जाता है, सेशन हाइजीन (session hygiene) मॉडल के चयन से बेहतर परिणाम देती है।
Batches. यदि उत्तर की प्रतीक्षा में कोई कार्य नहीं है, तो Message Batches API उन्हीं मॉडलों को "इनपुट और आउटपुट दोनों टोकन पर 50% छूट" के साथ चलाता है। यह नीचे दी गई तुलना की प्रत्येक पंक्ति को आधा कर देता है, और यह सभी टियर्स पर काम करता है: 1 सितंबर 2026 से, एक बैच किए गए Opus 4.8 जॉब की लागत मानक मूल्य पर एक सिंक्रोनस Sonnet 5 जॉब से कम होती है, जो समान बजट में लेटेंसी के बदले बेहतर क्षमता प्रदान करता है।
कार्यभार लागत तुलना
कार्यभार: 100,000 सपोर्ट ईमेल को वर्गीकृत करना, प्रत्येक के लिए एक कॉल, प्रति कॉल 2,000 इनपुट टोकन और 300 आउटपुट टोकन। यह 200 MTok इनपुट और 30 MTok आउटपुट है।
- Haiku 4.5: 200 x $1 = $200 इनपुट, 30 x $5 = $150 आउटपुट। कुल $350।
- Sonnet 5, परिचयात्मक दर: 200 x $2 = $400 इनपुट, 30 x $10 = $300 आउटपुट। कुल $700।
- Sonnet 5, 1 सितंबर 2026 से: 200 x $3 = $600 इनपुट, 30 x $15 = $450 आउटपुट। कुल $1,050।
- Opus 4.8: 200 x $5 = $1,000 इनपुट, 30 x $25 = $750 आउटपुट। कुल $1,750।
भविष्य की कीमतों के साथ इसे फिर से करने के लिए चार संख्याओं को बदलें। नीचे दिए गए समायोजन मॉडल के नाम की तुलना में परिणाम को अधिक प्रभावित करते हैं:
- Batching हर लाइन को आधा कर देता है: $175, $350, $525 और $875। रात भर चलने वाले वर्गीकरण कार्य के लिए कुछ भी प्रतीक्षा नहीं करता है, इसलिए इसे छोड़ने का कोई कारण नहीं है।
- साझा प्रीफिक्स को कैश करना। मान लें कि 2,000 इनपुट टोकन में से 1,200 टोकन हर बार एक ही निर्देश ब्लॉक हैं। Sonnet 5 पर परिचयात्मक दर पर, ये कैश हिट के रूप में $2 / MTok के बजाय $0.20 / MTok की लागत रखते हैं, इसलिए 120 MTok की लागत $240 के बजाय $24 आती है। $2 पर 80 MTok का नया इनपुट जोड़ें, जो $160 है, साथ ही $300 का आउटपुट जोड़ें, और Sonnet 5 $700 के बजाय लगभग $484 पर आ जाता है। यही ट्रिक Haiku 4.5 पर कोई काम नहीं करती है, क्योंकि 1,200 टोकन इसकी 4,096-टोकन की न्यूनतम सीमा से कम हैं।
- Retries (पुनः प्रयास)। मान लें कि आप 8% ईमेल पर Haiku के उत्तर को अस्वीकार करते हैं और उन्हें Opus 4.8 पर फिर से चलाते हैं। $350 में 0.08 x $1,750 = $140 जोड़ें, जिससे कुल $490 हो जाता है। मेरी दर उधार लेने के बजाय अपनी स्वयं की अस्वीकृति दर को मापें।
- टूल डेफिनिशन, यदि कार्य उनका उपयोग करता है। उनके द्वारा उत्पन्न सिस्टम प्रॉम्प्ट Opus 4.8 पर
tool_choiceकोautoपर सेट करने के साथ 290 टोकन, Sonnet 5 पर 354 और Haiku 4.5 पर 496 टोकन का है। सबसे सस्ता मॉडल सबसे अधिक निश्चित ओवरहेड वहन करता है।
$490 पर एस्केलेशन पाथ के साथ Haiku और $484 पर कैश किए गए Sonnet 5 की लागत समान है, और उनमें से एक ही बार में काम पूरा कर देता है। मॉडल कभी भी पूरा प्रश्न नहीं था।
क्या सत्र के बीच में मॉडल बदलने से पैसे की बचत होती है?
यह स्टिकर कीमतों से जितना दिखता है, उससे कम बार होता है, क्योंकि बचत प्रति टोकन होती है और आप एक पूरे कैश किए गए प्रीफिक्स (cached prefix) को जोखिम में डाल रहे होते हैं।
Anthropic ने प्रलेखित किया है कि क्या चीज़ कैश को अमान्य (invalidate) करती है। प्रीफिक्स tools, फिर system, और फिर messages के क्रम में बनाए जाते हैं, और "प्रत्येक स्तर पर परिवर्तन उस स्तर और उसके बाद के सभी स्तरों को अमान्य कर देता है।" दो अनुरोध सेटिंग्स भी उस सूची में हैं: "थिंकिंग कॉन्फ़िगरेशन और रिज़ॉल्व किया गया effort स्तर प्रॉम्प्ट में ही रेंडर हो जाते हैं, इसलिए उनमें से किसी को भी बदलने से एक नया कैश प्रीफिक्स शुरू हो जाता है।" प्रयास (effort) पर दस्तावेज़ और आगे जाते हैं: "कैश हिट पर निर्भर बातचीत के भीतर प्रयास को बदलने के बजाय वर्कलोड के अनुसार प्रयास को बदलें।"
मॉडल उस प्रलेखित सूची में नहीं है, इसलिए किसी भी तरह का अनुमान न लगाएं। स्विच करने के बाद पहले अनुरोध पर cache_read_input_tokens पढ़ें और संख्या को उत्तर देने दें। 150,000-टोकन Opus 4.8 प्रीफिक्स पर, एक कैश रीड की लागत लगभग $0.08 होती है और एक नए राइट की लागत लगभग $0.94 होती है, जो उस प्रति-टोकन अंतर के कई टर्न से अधिक है जिसे आप प्राप्त करने का प्रयास कर रहे थे।
इसलिए इन चीजों को कार्यों के बीच बदलें, एक कार्य के भीतर नहीं। Claude Code में इसका मतलब है कि पहले /clear करें, जब कैश वैसे भी हटाया जा रहा हो, फिर /model या /effort करें। ये दोनों CLI पर टाइप किए जाते हैं, इसलिए यदि आप Linux पर काम कर रहे हैं, तो टर्मिनल वाला इंस्टॉलेशन रखना फायदेमंद है, क्योंकि Anthropic जो Linux के लिए नेटिव रूप से प्रदान करता है वह एक स्थिर CLI को अभी भी बीटा में चल रहे डेस्कटॉप ऐप के साथ जोड़ता है। क्या यह स्वैप बिल में दिखाई देगा, यह इस बात पर निर्भर करता है कि आप उस सत्र के लिए भुगतान कैसे कर रहे हैं, क्योंकि Claude Code या तो फ्लैट मासिक प्लान पर चलता है या प्रति-टोकन API क्रेडिट पर और केवल दूसरा विकल्प ही मॉडल परिवर्तन की कीमत डॉलर में तय करता है। फ्लैट प्लान पर, एक भारी मॉडल का उपयोग करने की कीमत आपके इनवॉइस के बजाय आपकी उपयोग विंडो (usage window) है, और Claude Code प्रो और उससे ऊपर के प्लान में शामिल है और उसी विंडो का उपयोग करता है जिसका उपयोग चैट ऐप्स करते हैं, इसलिए टर्मिनल में Opus का एक घंटा वह समय है जिसे आप ब्राउज़र में खर्च नहीं कर रहे हैं।
अपने वर्कलोड पर उत्तर का परीक्षण कैसे करें
किसी अन्य मॉडल से ली गई संख्या के आधार पर प्रॉम्प्ट का आकार निर्धारित न करें। टोकन-काउंटिंग एंडपॉइंट उपयोग के लिए निःशुल्क है और जिस मॉडल का आप नाम लेते हैं, उसके टोकेनाइज़र के साथ गणना करता है, इसलिए उसी मॉडल का नाम लें जिसे आप कॉल करने की योजना बना रहे हैं। वह एंडपॉइंट प्लेटफॉर्म के उन कुछ हिस्सों में से एक है जिसके लिए कभी शुल्क नहीं लिया जाता है, और तुलना पर वास्तविक क्रेडिट खर्च करने से पहले बिना भुगतान किए आप और क्या चला सकते हैं यह देखना उचित है। Opus 4.7 और उसके बाद के संस्करण, Fable 5 और Sonnet 5 एक नए टोकेनाइज़र का उपयोग करते हैं जो "समान टेक्स्ट के लिए लगभग 30% अधिक टोकन उत्पन्न करता है", इसलिए पुराने मॉडल पर मापा गया बजट, अपरिवर्तित प्रति-टोकन दर पर नए मॉडल पर कम दिखाई देता है।
फिर जो परिणाम मिला उसे पढ़ें। input_tokens केवल अनकैश्ड शेष भाग है, इसलिए वास्तविक प्रॉम्प्ट आकार वह फ़ील्ड प्लस cache_creation_input_tokens प्लस cache_read_input_tokens है। VPS पर पहला Claude API ऐप उस माप को चलाने के लिए सबसे छोटा ईमानदार स्थान है, और कौन सा Claude प्लान आपके उपयोग के अनुकूल है यह एक अलग निर्णय है कि क्या आपको प्रति टोकन भुगतान करना है या नहीं। यदि यह प्रश्न इस बात का निकलता है कि कौन सा सब्सक्रिप्शन लेना है न कि यह कि क्या सब्सक्रिप्शन लेना है, तो ChatGPT के साथ Claude के टियर्स की कीमत यह बताती है कि वही कोडिंग कार्य दूसरे प्रदाता की सीटों पर कितना खर्च होता है। यदि माप आपके कार्य को स्थायी रूप से API पर भेजता है, तो सब्सक्रिप्शन को निचले टियर पर ले जाना या पूरी तरह बंद करना भी आपको वह अवधि प्रदान करता है जिसके लिए आप पहले ही भुगतान कर चुके हैं, इसलिए आंकड़े आने के बाद निर्णय लेने पर कोई दंड नहीं है। एक व्यक्ति के बजाय एक टीम के लिए वही माप चलाएं और योग का स्वरूप फिर से बदल जाता है, क्योंकि Team या Enterprise सीट को उस राशि से अधिक होना चाहिए जो वह व्यक्ति प्रति टोकन खर्च करता है, तभी उसे खरीदना सार्थक है।
FAQ
कोडिंग के लिए कौन सा Claude मॉडल सबसे अच्छा है?
जटिल एजेंटिक कोडिंग के लिए Claude Opus 4.8 को शुरुआती बिंदु माना गया है, जिसकी कीमत जुलाई 2026 तक $5 प्रति मिलियन इनपुट टोकन और $25 प्रति मिलियन आउटपुट टोकन है। Claude Sonnet 5 को गति और बुद्धिमत्ता का सबसे अच्छा संयोजन माना जाता है, और 31 अगस्त 2026 तक $2 / $10 की कीमत पर यह Sonnet 5 से आधे से भी कम महंगा है। दोनों पर एक ही कार्य चलाएं, थिंकिंग कॉन्फ़िगरेशन को समान रखें, और response.usage से कुल टोकन खर्च की तुलना करें।
क्या Claude Haiku 4.5 इतना सस्ता है कि Sonnet 5 की जगह ले सके?
टोकन के आधार पर, निश्चित रूप से: शुरुआती मूल्य निर्धारण पर Sonnet 5 के $2 / $10 की तुलना में यह $1 / $5 है, या 1 सितंबर 2026 से $3 / $15 है। सीमाएं इसका निर्णय करती हैं। Haiku 4.5 में 1M के बजाय 200K टोकन की कॉन्टेक्स्ट विंडो है, सिंक्रोनस Messages API पर 64K का अधिकतम आउटपुट है, फरवरी 2025 का विश्वसनीय नॉलेज कटऑफ है, कोई output_config.effort सपोर्ट नहीं है, और 4,096-टोकन का न्यूनतम कैश करने योग्य प्रॉम्प्ट है जो छोटे सिस्टम प्रॉम्प्ट पर कैशिंग को चुपचाप अक्षम कर देता है।
क्या सत्र के बीच में सस्ते Claude मॉडल पर स्विच करने से पैसे बचते हैं?
जितना दिखता है, उससे कम बार। Anthropic कैश इनवैलिडेटर्स को tools, system या messages प्रीफिक्स में बदलाव, थिंकिंग कॉन्फ़िगरेशन में बदलाव, और output_config.effort में बदलाव के रूप में दर्ज करता है। मॉडल स्विच करने से मौजूदा कैश पर क्या प्रभाव पड़ता है, यह प्रलेखित नहीं है, इसलिए इसे अज्ञात मानें और उसके बाद पहले अनुरोध पर cache_read_input_tokens को पढ़ें। दांव पर क्या लगा है यह जानना महत्वपूर्ण है: 150,000-टोकन वाले Opus 4.8 प्रीफिक्स पर कैश रीड की लागत लगभग $0.08 और नया राइट लगभग $0.94 है, जो प्रति-टोकन बचत के कई टर्न से अधिक है। कार्यों के बीच स्विच करें, Claude Code में /clear के बाद, जब कैश वैसे भी हटा दिया जा रहा हो।
output_config.effort मेरे बिल पर क्या प्रभाव डालता है?
यह बदलता है कि मॉडल टेक्स्ट, टूल कॉल और थिंकिंग पर कितने टोकन खर्च करता है। कम प्रयास (effort) से कम टूल कॉल होते हैं, जो एजेंटिक लूप पर बढ़ जाते हैं क्योंकि प्रत्येक टूल परिणाम बाद के टर्न में फिर से भेजा जाता है। स्तर low, medium, high, xhigh और max हैं, जिसमें high डिफ़ॉल्ट है। Anthropic प्रति स्तर कोई लागत गुणक (cost multiplier) प्रकाशित नहीं करता है, और प्रयास को टोकन बजट के बजाय एक व्यवहारिक संकेत मानता है, इसलिए इसे अपने स्वयं के कार्य पर मापें।
Claude Batches API कितनी बचत करता है?
असिंक्रोनस डिलीवरी के बदले इनपुट और आउटपुट दोनों टोकन पर 50% की बचत। जुलाई 2026 तक, यह Opus 4.8 को $2.50 इन / $12.50 आउट, Sonnet 5 को शुरुआती मूल्य निर्धारण पर $1 / $5, और Haiku 4.5 को $0.50 / $2.50 पर लाता है। ध्यान देने योग्य तुलना टियर के बीच चलती है: एक बैच किया गया Opus 4.8 जॉब 1 सितंबर 2026 से मानक दर पर सिंक्रोनस Sonnet 5 जॉब से कम लागत का है, इसलिए बैचिंग समान पैसे में एक अधिक शक्तिशाली मॉडल प्रदान करती है।