Claude API vs Subscription: कौन सा सस्ता है?
क्या Claude API या subscription बेहतर है? per-token rates और flat plan के बीच break-even गणित को समझें ताकि आप सही निर्णय ले सकें। अभी जांचें।
क्या Claude API सब्सक्रिप्शन से सस्ता है?
Claude API एक निश्चित उपयोग सीमा (volume) से नीचे होने पर सब्सक्रिप्शन से सस्ता होता है, और उससे ऊपर होने पर अधिक महंगा। एक डेवलपर के लिए जो पूरे दिन इंटरैक्टिव कोडिंग करता है, आमतौर पर फ्लैट प्लान (flat plan) बेहतर रहता है। उस प्रोग्राम के लिए जो अपने स्वयं के कॉल्स करता है, API ही एकमात्र विकल्प है, इसलिए लागत वहां निर्णय लेने वाला कारक नहीं है। बाकी गणित आप दस मिनट में कर सकते हैं।
कोई आधिकारिक break-even नंबर उपलब्ध नहीं है। सब्सक्रिप्शन को टोकन अलाउंसेंस के बजाय usage windows के रूप में बेचा जाता है, इसलिए कोई भी प्रकाशित आंकड़ा आपको यह नहीं बता सकता कि दोनों रेखाएं कहां मिलती हैं। नीचे दिया गया फॉर्मूला वर्तमान per-token दरों पर आधारित है, साथ ही इसमें आपके व्यवहार के वे हिस्से भी शामिल हैं जो उत्तर को प्लान फीस से कहीं अधिक प्रभावित करते हैं। नीचे दिया गया प्रत्येक break-even आंकड़ा प्रकाशित दरों और घोषित धारणाओं से मेरा अपना गणित है, यह कोई दस्तावेजीकृत नंबर नहीं है।
यदि आप अभी भी यह तय कर रहे हैं कि कौन सा प्लान खरीदना है, तो कौन सा Claude प्लान आपके काम करने के तरीके के अनुकूल है इसका उत्तर देता है। यह पोस्ट मानती है कि आप जानते हैं कि आप कौन सा प्लान खरीदेंगे, और आप यह जानना चाहते हैं कि क्या आपको इसे खरीदना चाहिए या नहीं।
दो बिलिंग मॉडल जो एक जैसे नहीं हैं
सब्सक्रिप्शन एक क्षमता (capacity) है जिसका आप उपयोग नहीं कर सकते। आप एक निश्चित शुल्क देते हैं और एक अलाउंस प्राप्त करते हैं जो एक शेड्यूल पर रीसेट होता है। Anthropic के Claude Code दस्तावेज़ में Team और Enterprise सीटों के लिए विवरण दिया गया है: उपयोग "एक per-seat अलाउंस से लिया जाता है जो एक rolling five-hour window और एक weekly window पर रीसेट होता है", जो Claude chat और Cowork के साथ साझा किया जाता है। एक सब्सक्राइबर उसी सीमा को अपने संदेशों के माध्यम से महसूस करता है, जो "You've hit your session limit" और "You've hit your weekly limit" के रूप में दिखाई देते हैं। जिस क्षमता का आप उपयोग नहीं करते हैं, वह पैसा है जो आपने फिर भी खर्च कर दिया। जिस क्षमता से आप अधिक उपयोग करते हैं, वह आपके काम को तब तक रोक देती है जब तक कि window रीसेट न हो जाए, और /model के साथ मॉडल बदलना एक्सेस को बहाल नहीं करता है, क्योंकि windows सभी मॉडलों के लिए साझा की जाती हैं।
API एक मीटर है जो कभी नहीं रुकता। इसमें कोई window या सीमा (wall) नहीं है। प्रत्येक अनुरोध की कीमत per token के अनुसार होती है, और कुछ चीजें tokens के बाहर priced होती हैं: वेब सर्च "Claude API पर $10 प्रति 1,000 सर्च के लिए उपलब्ध है"। कोई भी चीज़ सीमा पर नहीं रुकती। इनवॉइस बस बढ़ता जाता है।
23 July 2026 तक की प्लान फीस, Claude pricing page से: Pro "$17 प्रति माह वार्षिक सब्सक्रिप्शन छूट के साथ ($200 अग्रिम बिलिंग)। $20 यदि मासिक बिलिंग हो", और इसमें Claude Code शामिल है। Max को "From $100 प्रति माह" के रूप में सूचीबद्ध किया गया है। Team सीटें "$20 प्रति सीट / माह यदि वार्षिक बिलिंग हो" से शुरू होती हैं। Enterprise सबसे दिलचस्प है, क्योंकि यह दोनों मॉडलों को एक साथ चलाता है: "Seat price + usage at API rates $20/seat"। फीस अक्सर बदलती रहती है, और प्रत्येक के पीछे का अलाउंस कभी भी tokens में प्रकाशित नहीं किया जाता है, इसलिए जिस दिन आप निर्णय लें उस दिन pricing page पढ़ें।
जो आप API से प्राप्त नहीं कर सकते
एक प्लान अलाउंसेंस, और उसके चारों ओर बना इंटरफ़ेस। Claude Code का /usage-credits कमांड सब्सक्रिप्शन उपयोग क्रेडिट को मैनेज करता है, और आप इसे "/login के माध्यम से अपनी claude.ai सब्सक्रिप्शन के साथ साइन इन करने के बाद" चलाते हैं; यह कमांड API key authentication के साथ उपलब्ध नहीं है। /usage स्क्रीन भी बिलिंग मोड के आधार पर भिन्न होती है: इसका Session ब्लॉक "API token usage दिखाता है और API उपयोगकर्ताओं के लिए बनाया गया है", जबकि सब्सक्राइबर के बजाय प्लान उपयोग बार और उपयोग का विवरण देखते हैं।
Claude Code में एक लंबा prompt cache। इसमें वास्तविक पैसा खर्च होता है और इसे मिस करना आसान है। दस्तावेज़ कहता है "सब्सक्रिप्शन पर इसकी लाइफटाइम एक घंटा है और एक बार जब आप usage credits का उपयोग करने लगते हैं तो यह पांच मिनट हो जाती है; API key या क्लाउड प्रोवाइडर पर, यह डिफ़ॉल्ट रूप से पांच मिनट है"। cache lifetime से लंबे ब्रेक के बाद आपका पहला संदेश cache को मिस कर देता है, इसलिए आपका पूरा context फिर से प्रोसेस होता है और write prices पर बिल किया जाता है। सब्सक्रिप्शन पर आप पचास मिनट की मीटिंग ले सकते हैं और वापस आकर काम जारी रख सकते हैं। API key पर वही ब्रेक सत्र के prefix के पूर्ण re-write की लागत लगाता है।
जो आप सब्सक्रिप्शन से प्राप्त नहीं कर सकते
Programmatic access। एक cron job या webhook handler जो Claude को कॉल करता है, उसे API key की आवश्यकता होती है, इसलिए यदि वह आपका वर्कलोड है तो तुलना समाप्त होती है। VPS पर अपना पहला Claude API app बनाना key handling और पहले वर्किंग स्क्रिप्ट को कवर करता है।
Batch API डिस्काउंट। pricing page इसे स्पष्ट रूप से बताता है: "Batch API इनपुट और आउटपुट दोनों tokens पर 50% डिस्काउंट के साथ अनुरोधों के बड़े वॉल्यूम की asynchronous प्रोसेसिंग की अनुमति देता है।" यह उस किसी भी काम के लिए मीटर को आधा कर देता है जिसके लिए कोई इंसान प्रतीक्षा नहीं कर रहा है। Opus 4.8 पर प्रति मिलियन tokens के Batch rates $2.50 इन और $12.50 आउट हैं, Sonnet 5 पर introductory pricing पर $1 और $5, और Haiku 4.5 पर $0.50 और $2.50 हैं। ट्रेड-ऑफ latency है: अधिकांश batches एक घंटे के भीतर समाप्त हो जाते हैं, एक batch जो 24 घंटों के भीतर पूरा नहीं होता है वह समाप्त (expire) हो जाता है, और streaming को batch नहीं किया जा सकता है। Batch और prompt caching एक साथ काम करते हैं, और क्योंकि एक batch पांच मिनट से अधिक समय तक चल सकता है, इसलिए इसके अंदर 1-hour cache का उपयोग करें।
Per-project cost attribution। प्रत्येक API रिस्पॉन्स एक usage ब्लॉक लौटाता है, इसलिए आप एक एकल अनुरोध की लागत को लॉग कर सकते हैं और इसे किसी प्रोजेक्ट या ग्राहक को दे सकते हैं। सब्सक्रिप्शन उस व्यक्ति के लिए उपयोग बार का एक सेट रिपोर्ट करता है जिसके पास सीट है।
एक बात सावधानी से कहें, क्योंकि दोनों दिशाओं में मान लेना आसान है: ये अलग-अलग बिलिंग सतहें हैं। Anthropic के दस्तावेज़ सब्सक्रिप्शन बिलिंग को claude.ai support को और Console बिलिंग को API प्लेटफॉर्म को भेजते हैं, और /usage-credits API key के तहत काम नहीं करता है। मैंने जो जांचा है उसमें कुछ भी यह नहीं कहता कि सब्सक्रिप्शन में API credit शामिल है, इसलिए दो खातों और दो बिलों की योजना बनाएं।
Break-even फॉर्मूला
एक turn की कीमत निकालें, फिर उसे scale करें।
turn cost = uncached_input_tokens x base_input_price
+ cache_write_tokens x 1.25 x base_input_price
+ cache_read_tokens x 0.10 x base_input_price
+ output_tokens x output_price
monthly API cost = turn cost x turns_per_active_day x active_days_per_month
break even when: monthly API cost = flat plan feeMultipliers प्रकाशित हैं, अनुमानित नहीं। 5-minute cache write की लागत "1.25x base input price" है, 1-hour write की लागत "2x base input price" है, और cache read की लागत "0.1x base input price" है। Thinking tokens को output tokens के रूप में बिल किया जाता है, इसलिए वे output_tokens में आते हैं, भले ही वे मॉडल न हों जो reasoning summary प्रदर्शित नहीं करते हैं।
प्रति मिलियन tokens (MTok) पर Base rates, वर्तमान 23 July 2026:
claude-fable-5: $10 input, $50 output. Cache read $1. 5-minute cache write $12.50. 1M context.claude-opus-4-8औरclaude-opus-4-7: $5 input, $25 output. Cache read $0.50. 5-minute cache write $6.25. 1M context.claude-sonnet-5: 31 August 2026 तक introductory pricing पर $2 input, $10 output, उसके बाद $3 और $15। Introductory rates पर, cache read $0.20 और 5-minute cache write $2.50। 1M context.claude-haiku-4-5: $1 input, $5 output. Cache read $0.10. 5-minute cache write $1.25. 200K context.
लंबे context के लिए कोई surcharge नहीं है: "एक 900k-token अनुरोध को उसी per-token दर पर बिल किया जाता है जिस पर 9k-token अनुरोध को बिल किया जाता है।"
एक उदाहरण, धारणाओं के साथ
Sonnet 5 पर 60,000 tokens के context वाले एक mid-session Claude Code turn लें: 55,000 cache से, 3,000 नए cache में लिखे गए, 2,000 fresh uncached input tokens, और 1,200 output tokens (thinking सहित)।
- Cache reads: 55,000 x $0.20/MTok = $0.0110
- Cache writes: 3,000 x $2.50/MTok = $0.0075
- Uncached input: 2,000 x $2.00/MTok = $0.0040
- Output: 1,200 x $10.00/MTok = $0.0120
यह लगभग $0.035 प्रति turn है। एक सक्रिय दिन में 120 turns पर, लगभग $4.14 प्रतिदिन। महीने में 20 सक्रिय दिनों पर, लगभग $83 प्रति माह।
इसकी तुलना ऊपर दी गई फ्लैट फीस से करें और यह दो बातें एक साथ बताता है। यह Pro फीस से लगभग चार गुना है, इसलिए Pro कागजी तौर पर सस्ता है, बशर्ते उसका अलाउंसेंस प्रतिदिन 120 Sonnet turns को संभाल सके। यह शर्त वह है जिसे कोई भी प्रकाशित नंबर आपके लिए तय नहीं कर सकता। यही $83 प्रवेश स्तर की Max फीस से नीचे है, इसलिए यहाँ मीटर Max से बेहतर है।
अब एक बार में एक धारणा बदलें, और देखें कि कैसे प्लान फीस निर्णायक नंबर बनना बंद कर देती है।
तीन चीजें जो break-even को प्लान की कीमत से अधिक प्रभावित करती हैं
Prompt caching। बिना caching के वही 60,000-token turn चलाएं और पूरा prompt fresh input के रूप में बिल किया जाएगा: 60,000 x $2.00/MTok = $0.12, plus $0.012 output, यानी $0.132 प्रति turn। यह cached turn से लगभग चार गुना है, और यह $83 के महीने को लगभग $317 में बदल देता है। यह वह एक break-even है जिसे Anthropic प्रकाशित करता है, क्योंकि यह आपके वर्कलोड पर निर्भर नहीं करता है: "एक cache hit की लागत standard input price का 10% होती है, जिसका अर्थ है कि caching केवल एक cache read (5-minute duration के लिए 1.25x write) या दो cache reads (1-hour duration के लिए 2x write) के बाद लाभ देती है।"
दो failure modes बिना बताए caching को बंद कर देते हैं। पहला है मॉडल की न्यूनतम cacheable लंबाई से छोटा prefix: Fable 5 पर 512 tokens, Opus 4.8 और Sonnet 5 पर 1,024, Opus 4.7 पर 2,048, और Haiku 4.5 पर 4,096। छोटा prefix cache नहीं होता है, और कोई error नहीं आता है। दूसरा है parallel requests, क्योंकि "एक cache entry केवल पहली response शुरू होने के बाद ही उपलब्ध होती है।" एक साथ भेजे गए दस समान अनुरोध सभी पूर्ण input price देते हैं। दोनों के लिए संकेत cache_read_input_tokens का शून्य पर होना है।
Model choice। Opus 4.8 पर समान turn की कीमत निकालें, $5 in और $25 out, $0.50 cache reads और $6.25 per MTok 5-minute writes के साथ: reads $0.0275, writes $0.0188, uncached input $0.0100, output $0.0300। यह लगभग $0.086 प्रति turn है, Sonnet turn से 2.5 गुना, और समान वॉल्यूम पर लगभग $207 प्रति माह। एक मॉडल विकल्प ने उसी काम को प्रवेश स्तर की Max फीस से नीचे से उठाकर उससे दोगुने से अधिक पर पहुँचा दिया। Haiku 4.5 ($1 और $5 पर) लॉग ट्राइएज जैसे मैकेनिकल काम के लिए इसे दूसरी दिशा में ले जाता है।
Effort level मॉडल विकल्प का हिस्सा है, क्योंकि thinking tokens output rates पर बिल किए जाते हैं। Opus 4.8 पर API डिफ़ॉल्ट high है, और कोडिंग और agentic काम के लिए प्रलेखित शुरुआती बिंदु अधिक महंगा xhigh है। Claude Code में /effort के साथ या API पर output_config.effort के साथ इसे कम करें। एक और चीज़ पुराने अनुमानों को बदल देती है: नए मॉडल एक नए tokenizer का उपयोग करते हैं जो "उसी टेक्स्ट के लिए लगभग 30% अधिक tokens उत्पन्न करता है", इसलिए पुराने मॉडल पर मापा गया count आज उसी टेक्स्ट के लिए कम होगा।
Session hygiene। API stateless है, इसलिए प्रत्येक turn पूरी बातचीत को billed input के रूप में फिर से भेजता है। इसलिए एक लंबा session प्रत्येक संदेश के लिए नए session की तुलना में अधिक लागत लेता है, जो अधिकांश आश्चर्यजनक इनवॉइस के पीछे का तंत्र है और इसे Claude Code session में वास्तव में tokens क्या खर्च करता है में विस्तार से समझाया गया है। असंबंधित कार्यों के बीच /clear चलाएं, क्योंकि पुराना context प्रत्येक बाद के संदेश पर फिर से भेजा और बिल किया जाता है। एक लंबे कार्य के भीतर /compact चलाएं, ताकि इतिहास को पूरी तरह से ले जाने के बजाय सारांशित किया जा सके। निरंतर अंतराल (continuous stints) में काम करें, क्योंकि डिफ़ॉल्ट cache "का 5-minute lifetime होता है" और "हर बार जब cached content का उपयोग किया जाता है तो बिना किसी अतिरिक्त लागत के रिफ्रेश किया जाता है"। हर दस मिनट में एक बार छूने वाला session हर बार एक re-write का भुगतान करता है। एक अलग VPS पर tmux में चलने वाला Claude Code session खाली बैठने के दौरान लगभग कुछ भी खर्च नहीं करता है, लेकिन cache lifetime से अधिक देर तक खाली रहने पर फिर भी warm prefix का नुकसान होता है।
निर्णय लेने से पहले अपने उपयोग को मापें
मेरे उदाहरण से निर्णय न लें। अपने एक सप्ताह के उपयोग से निर्णय लें।
Claude Code में, एक सप्ताह के लिए प्रत्येक session के अंत में /usage चलाएं (/cost उसी स्क्रीन का alias है)। यह session के token counts और एक cost estimate की रिपोर्ट करता है, दस्तावेज़ से एक चेतावनी के साथ: "डॉलर फिगर एक अनुमान है जो token counts से स्थानीय रूप से गणना किया गया है और आपके वास्तविक बिल से भिन्न हो सकता है।" जब आप /clear चलाते हैं तो totals रीसेट हो जाते हैं, इसलिए पहले स्क्रीन पढ़ें। सब्सक्रिप्शन पर वह डॉलर फिगर आपका बिल नहीं है, लेकिन उसके पीछे के token counts वह हैं जिनकी इस फॉर्मूले को आवश्यकता है। /context दिखाता है कि window में क्या भर रहा है।
API खाते पर, Claude Console में usage page आधिकारिक रिकॉर्ड है। किसी prompt को भेजने से पहले उसकी कीमत जानने के लिए, client.messages.count_tokens() "मुफ्त में उपयोग करने के लिए उपलब्ध है लेकिन आपके usage tier के आधार पर requests per minute की दर सीमाओं के अधीन है", और यह एकमात्र count है जो उस tokenizer का उपयोग करता है जिसके लिए आपको वास्तव में बिल किया जाएगा।
एक call के बाद, usage block पढ़ें, और इसे सही ढंग से पढ़ें:
u = response.usage
total_input = u.input_tokens + u.cache_creation_input_tokens + u.cache_read_input_tokensinput_tokens केवल uncached remainder को गिनता है, जिसे "tokens after the last cache breakpoint" के रूप में प्रलेखित किया गया है। input_tokens: 4000 रिपोर्ट करने वाला turn 4,000-token turn नहीं है, और तीनों fields का योग वह prompt size है जो इस फॉर्मूले को चाहिए।
फिर तुलना करें। यदि आपका मापा गया महीना स्पष्ट रूप से प्लान फीस से नीचे आता है, तो मीटर (API) चुनें। यदि यह स्पष्ट रूप से ऊपर आता है, तो प्लान चुनें, बशर्ते उसका अलाउंसेंस आपके लिए एक सामान्य कार्य दिवस को संभाल सके। यदि यह रेखा के पास आता है, तो प्लान चुनें, क्योंकि एक प्लान आपको आश्चर्यचकित नहीं कर सकता और एक मीटर कर सकता है।
FAQ
क्या Claude API, Claude Pro या Max से सस्ता है?
यह वॉल्यूम पर निर्भर करता है, और कोई प्रकाशित break-even नहीं है जिसे देखा जा सके, क्योंकि सब्सक्रिप्शन को token allowances के बजाय usage windows के रूप में बेचा जाता है। प्रकाशित per-token दरों से एक विशिष्ट turn की कीमत निकालें, इसे आपके प्रतिदिन के turns और महीने के सक्रिय दिनों से गुणा करें, फिर उस आंकड़े की तुलना प्लान फीस से करें। एक उदाहरण में, 60,000-token Sonnet 5 turn लगभग $0.035 आया, या 20 दिनों में प्रतिदिन 120 turns पर लगभग $83 प्रति माह: Pro फीस से ऊपर, प्रवेश स्तर की Max फीस से नीचे।
मैं प्रति माह अपनी Claude API लागत कैसे निकालूँ?
वास्तविक token counts एकत्र करने के लिए एक सप्ताह तक Claude Code में /usage चलाएं, या यदि आपके पास पहले से ही API खाता है तो Claude Console में usage page पढ़ें। फिर एक turn की कीमत निकालें: base rate पर uncached input, base input का 1.25 गुना पर cache writes, base input का 0.1 गुना पर cache reads, और output rate पर output, thinking tokens को output मानकर। इसे प्रतिदिन के turns और महीने के सक्रिय दिनों से गुणा करें।
Claude API बिल को सबसे अधिक क्या बदलता है?
Prompt caching, किसी भी अन्य चीज़ से अधिक। Sonnet 5 पर 60,000-token turn लगभग $0.035 खर्च करता है जब prefix cache से लिया जाता है, और लगभग $0.132 खर्च करता है जब ऐसा नहीं होता है। मॉडल विकल्प अगला है: Opus 4.8 पर वही turn लगभग $0.086 खर्च करता है। Session की लंबाई तीसरा है, क्योंकि API stateless है और प्रत्येक turn पूरी बातचीत को billed input के रूप में फिर से भेजता है।
क्या Claude सब्सक्रिप्शन में API एक्सेस शामिल है?
इन्हें दो बिलों वाले दो खातों के रूप में मानें। API calls को Console में आपके द्वारा बनाए गए खाते के विरुद्ध per token बिल किया जाता है, और मैंने जो दस्तावेज़ जांचा है उसमें कुछ भी यह नहीं कहता कि सब्सक्रिप्शन API credit देता है। यह स्पष्ट संकेत कि वे अलग सतहें हैं, Claude Code का /usage-credits कमांड है, जो "API key authentication के साथ उपलब्ध नहीं है"। कई डेवलपर्स दोनों रखते हैं: इंटरैक्टिव कोडिंग के लिए एक प्लान, और उनके द्वारा बनाई गई चीज़ों के लिए एक key।