Claude में 1M tokens की कीमत कितनी है?
Claude में 1M tokens की सटीक लागत जानने के लिए यह गाइड पढ़ें। हम input और output के अलग-अलग रेट्स और आपके मासिक बिल पर पड़ने वाले प्रभाव का पूरा गणित विस्तार से समझा रहे हैं।
Claude में 1M tokens की कीमत कितनी है?
1M tokens का अर्थ है दस लाख tokens, और यह वह इकाई है जिसमें हर Claude API (application programming interface) की कीमत निर्धारित की जाती है। इसकी कोई एक निश्चित कीमत नहीं है, क्योंकि input और output के लिए अलग-अलग दरें ली जाती हैं और प्रत्येक model की अपनी अलग दर होती है। अगस्त 2026 तक, दस लाख input tokens की कीमत Claude Haiku 4.5 पर $1, Claude Sonnet 5 पर $2 और Claude Opus 5 पर $5 है।
Output वाला हिस्सा अधिक महंगा होता है। वर्तमान के हर model पर output की दर input की दर से पांच गुना अधिक है, इसलिए इन दोनों के बीच का अनुपात आपके बिल को मुख्य आंकड़े से कहीं अधिक प्रभावित करता है। जो app लंबे दस्तावेज़ भेजता है और छोटे उत्तर प्राप्त करता है, उसका व्यवहार उस app से बिल्कुल अलग होता है जो छोटे prompt से लंबे उत्तर लिखता है।
यह पृष्ठ unit economics के बारे में है: एक token की लागत क्या है, और निर्माण करने से पहले बिल का अनुमान कैसे लगाया जाए। काम करते समय tokens वास्तव में कहाँ खर्च होते हैं, यह जानने के लिए Claude Code session के भीतर tokens कहाँ जाते हैं पढ़ें।
1M tokens क्या होते हैं
टोकन टेक्स्ट का वह हिस्सा है जिसे मॉडल पढ़ता या लिखता है। Anthropic के सामान्य अनुमान के अनुसार, एक टोकन में लगभग 4 अक्षर या अंग्रेजी के 0.75 शब्द होते हैं। इसलिए, दस लाख (1M) टोकन लगभग 750,000 शब्दों या लगभग 4 MB प्लेन टेक्स्ट के बराबर होते हैं।
सामान्य इनपुट के लिए प्रकाशित अनुमान इस पैमाने को बेहतर ढंग से समझने में मदद करते हैं।
The data behind this chart
[
{
"label": "Average web page (10 kB)",
"tokens": "2,500"
},
{
"label": "Documentation page (100 kB)",
"tokens": "25,000"
},
{
"label": "Research paper PDF (500 kB)",
"tokens": "125,000"
}
]इन दरों के आधार पर, 1M टोकन का मतलब है लगभग 400 औसत वेब पेज जिन्हें एक बार पढ़ा गया हो, या उस आकार के आठ शोध पत्र। यह एक मध्यम आकार के कोडबेस का एक बार का विश्लेषण है, या किसी एक व्यक्ति के लिए एक महीने की हल्की चैट का उपयोग है।
इन सभी को केवल एक अनुमान मानें। कोड, JSON और अंग्रेजी के अलावा अन्य भाषाओं के टेक्स्ट में एक टोकन में कम शब्द समाते हैं, इसलिए 0.75 का अनुपात सबसे आशावादी स्थिति है। एक और चीज गिनती को प्रभावित करती है: Claude Opus 4.7 और उसके बाद के वर्ज़न, जिसमें Opus 5 और Sonnet 5 शामिल हैं, एक नए टोकेनाइज़र का उपयोग करते हैं जो Sonnet 4.6 और उससे पुराने वर्ज़न की तुलना में समान टेक्स्ट के लिए लगभग 30 प्रतिशत अधिक टोकन उत्पन्न करता है। Claude Haiku 4.5 पुराने टोकेनाइज़र का उपयोग करता है। इसलिए, Haiku 4.5 पर मापी गई गिनती Sonnet 5 पर समान इनपुट के लिए कम हो सकती है, जिसका अर्थ है कि इस सीमा के पार प्रति-मिलियन मूल्य की सीधी तुलना करना उचित नहीं है। कोई भी निर्णय लेने से पहले दोनों मॉडलों पर एक ही प्रॉम्प्ट की गिनती करें।
Claude प्रति मिलियन टोकन के लिए कितना शुल्क लेता है
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5
},
{
"label": "Sonnet 5 (to 31 Aug 2026)",
"input_usd": 2,
"output_usd": 10
},
{
"label": "Sonnet 5 (from 1 Sep 2026)",
"input_usd": 3,
"output_usd": 15
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25
}
]Claude Sonnet 5 पर 31 अगस्त 2026 तक $2 इनपुट और $10 आउटपुट की प्रारंभिक कीमत लागू है। 1 सितंबर 2026 से मानक दर लागू होगी: $3 इनपुट और $15 आउटपुट। Claude Opus 5 की दर $5 इनपुट और $25 आउटपुट है। एक मॉडल इस चार्ट से पूरी तरह ऊपर है: Claude Fable 5 की सूची दर $10 इनपुट और $50 आउटपुट है, इसलिए क्या ये दरें चुकाने योग्य हैं यह इस बात पर निर्भर करता है कि आप इसे किन कार्यों के लिए उपयोग करते हैं।
दरें बदलती रहती हैं। इस पृष्ठ पर दिए गए प्रत्येक आंकड़े को अगस्त 2026 की तारीख वाला एक उदाहरण मानें, और बजट को अंतिम रूप देने से पहले आधिकारिक मूल्य निर्धारण पृष्ठ पर वर्तमान संख्याओं की पुष्टि करें।
ये दरें बताती हैं कि Claude की लागत क्या है, लेकिन यह नहीं कि क्या यह आपके वर्कलोड के लिए सस्ता विकल्प है, और Claude और ChatGPT दोनों पर तीन कार्यों की लागत यह दर्शाती है कि कौन सा API कहाँ बेहतर प्रदर्शन करता है।
एक चीज जो दर को नहीं बदलती, वह है कॉन्टेक्स्ट लेंथ। Claude 4.6 और उसके बाद के वर्ज़न में, पूरे 1M टोकन कॉन्टेक्स्ट विंडो के लिए मानक मूल्य निर्धारण पर बिलिंग की जाती है, इसलिए 900,000 टोकन के अनुरोध की लागत प्रति टोकन के हिसाब से 9,000 टोकन के अनुरोध के समान ही होती है। एक लंबा प्रॉम्प्ट अधिक महंगा होता है क्योंकि इसमें अधिक टोकन होते हैं, और इसके लिए कोई अलग लंबी-कॉन्टेक्स्ट दर लागू नहीं होती है।
मूल्य परिवर्तन के बाद भी जो गणना बनी रहती है
प्रत्येक बिल दो गुणा और एक जोड़ का परिणाम होता है।
cost = (input_tokens / 1,000,000) * input_rate
+ (output_tokens / 1,000,000) * output_rateइसे उस कोड के रूप में लिखें जिसे आप चला सकें:
INPUT_RATE = 2.00 # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00 # USD per million output tokens
def cost(input_tokens, output_tokens):
return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000
print(f"{cost(4300, 400):.4f}")यह 0.0126 प्रिंट करता है। एक अनुरोध जो 4,300 इनपुट टोकन भेजता है और 400 आउटपुट टोकन प्राप्त करता है, उसकी लागत Sonnet 5 पर लगभग 1.3 सेंट होती है। दोनों दरों को अपने कोड में एक ही स्थान पर रखें। जब कोई मूल्य बदलता है, तो आप दो पंक्तियों को संपादित करते हैं, और आपके सिस्टम का प्रत्येक अनुमान उसके साथ अपडेट हो जाता है।
एक वास्तविक ऐप के लिए कार्यशील अनुमान
एक सपोर्ट असिस्टेंट का उदाहरण लें। इसका सिस्टम प्रॉम्प्ट और प्रोडक्ट डॉक्यूमेंटेशन कुल 4,000 टोकन का है, और ये हर रिक्वेस्ट के साथ भेजे जाते हैं, क्योंकि Messages API स्टेटलेस है और मॉडल को कॉल्स के बीच कुछ भी याद नहीं रहता। उपयोगकर्ता का एक प्रश्न लगभग 300 टोकन जोड़ता है। एक उत्तर लगभग 400 टोकन का होता है। इस प्रकार प्रति रिक्वेस्ट 4,300 इनपुट और 400 आउटपुट टोकन खर्च होते हैं।
एक मिलियन इनपुट टोकन में इस आकार की लगभग 232 रिक्वेस्ट पूरी हो सकती हैं। 1,000 रिक्वेस्ट प्रतिदिन के हिसाब से ऐप प्रतिदिन 4.3 मिलियन इनपुट टोकन की खपत करता है, इसलिए "1M टोकन" छह घंटे से भी कम का ट्रैफिक है।
The data behind this chart
[
{
"label": "Opus 5, list rates",
"cost_per_1k_usd": "31.50"
},
{
"label": "Sonnet 5, list rates",
"cost_per_1k_usd": "12.60"
},
{
"label": "Sonnet 5, Batch API",
"cost_per_1k_usd": "6.30"
},
{
"label": "Haiku 4.5, list rates",
"cost_per_1k_usd": "6.30"
},
{
"label": "Sonnet 5, warm prompt cache",
"cost_per_1k_usd": "5.40"
}
]Claude Opus 5 पर उस ट्रैफिक की लागत प्रति 1,000 रिक्वेस्ट $31.50 है। Sonnet 5 पर यह $12.60 है। Claude Haiku 4.5 पर स्विच करने से यह $6.30 हो जाती है, और Sonnet 5 पर वार्म प्रॉम्प्ट कैश का उपयोग करने से यह और भी कम, $5.40 हो जाती है।
इस ट्रैफिक के एक महीने के लिए इसे 30 से गुणा करें। लिस्ट रेट पर Sonnet 5 का खर्च लगभग $378 प्रति माह है। वार्म कैश के साथ वही ऐप लगभग $162 का पड़ता है। आपके मॉडल का चुनाव और कैशिंग का निर्णय, दोनों ही इस वॉल्यूम पर आपके द्वारा नेगोशिएट की गई किसी भी दर से अधिक मूल्यवान हैं। कौन सा मॉडल चलाना है, यह अपने आप में एक अलग प्रश्न है, और जो सबसे सस्ता मॉडल आपके इवैल्यूएशन को पास करता है, वही बेहतर है: Opus, Sonnet और Haiku के बीच चयन में इसे सही ढंग से टेस्ट करने का तरीका बताया गया है।
Prompt caching बार-बार आने वाले हिस्से को कम करता है
वह 4,000 token का prefix हर request पर एक समान होता है, और आप हर बार इसके लिए पूरा input मूल्य चुकाते हैं। Prompt caching प्रोसेस किए गए prefix को स्टोर करता है और इसे दोबारा इस्तेमाल करने पर कम दर पर शुल्क लेता है।
Cache read की लागत base input दर का 0.1 गुना होती है। Cache write की लागत 5 मिनट के lifetime के लिए base का 1.25 गुना, या 1 घंटे के lifetime के लिए base का 2 गुना होती है। इसलिए 5 मिनट वाला cache एक बार read करने के बाद ही अपनी लागत निकाल लेता है, क्योंकि write की लागत 0.25 अतिरिक्त होती है जबकि हर read पर 0.9 की बचत होती है। 1 घंटे वाले cache को लागत निकालने के लिए दो बार read करने की आवश्यकता होती है।
इसे चालू करने का सबसे सरल तरीका एक single top-level field है:
curl https://api.anthropic.com/v1/messages \
-H "content-type: application/json" \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"max_tokens": 1024,
"cache_control": {"type": "ephemeral"},
"system": "You are a helpful assistant.",
"messages": [
{"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
]
}'इसके बाद वापस आने वाले usage block को पढ़ें:
{
"usage": {
"cache_creation_input_tokens": 5120,
"cache_read_input_tokens": 1800,
"input_tokens": 50,
"output_tokens": 503
}
}वे तीन input counters तीन अलग-अलग दरों पर बिल किए जाते हैं और वे आपके वास्तविक input volume का योग होते हैं: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens। एक cost estimate जो केवल input_tokens को पढ़ता है, caching चालू होने के बाद पूरी तरह गलत हो जाएगा।
दो चीजें cache को फायदेमंद होने से रोकती हैं, और दोनों ही बिना किसी error message के विफल हो जाती हैं।
Prefix का byte-identical होना अनिवार्य है। Cache lookup एक prefix match है, इसलिए आपके system prompt के शीर्ष पर मौजूद timestamp या user का नाम हर request पर इसे बदल देता है। ऐसी स्थिति में आप हर बार base input का 1.25 गुना भुगतान करते हैं और एक बार भी cache read नहीं होता। इसका लक्षण यह है कि cache_creation_input_tokens अधिक रहता है जबकि cache_read_input_tokens 0 पर रहता है। cache_control को उस अंतिम block पर रखें जिसकी सामग्री सभी requests में समान रहती है, और जो कुछ भी बदलता है उसे उसके बाद रखें। अपने tools definitions को बदलने से उनके नीचे का पूरा cache अमान्य (invalidate) हो जाता है, क्योंकि invalidation का क्रम tools, फिर system, और फिर messages होता है।
Prefix का पर्याप्त लंबा होना अनिवार्य है। न्यूनतम cacheable लंबाई Opus 5 पर 512 tokens, Sonnet 5 पर 1,024 tokens और Haiku 4.5 पर 4,096 tokens है। इससे छोटा prompt cache नहीं होता और कोई error भी वापस नहीं मिलता। ऊपर दिए गए उदाहरण में 4,000 token का prefix Sonnet 5 पर cache हो जाता है लेकिन Haiku 4.5 पर नहीं, क्योंकि 4,000 उस model की न्यूनतम सीमा से कम है। जब दोनों counters 0 दर्शाते हैं, तो इसका मतलब है कि कुछ भी cache नहीं हुआ।
Batch processing दर को आधा कर देता है
Batch API अनुरोधों को इनपुट और आउटपुट दोनों पर 50 प्रतिशत की छूट के साथ asynchronously प्रोसेस करता है। ऊपर दिए गए उदाहरण में, यह $12.60 प्रति 1,000 अनुरोधों की लागत को $6.30 में बदल देता है। यह छूट prompt caching के साथ जुड़ जाती है, इसलिए bulk work चलाने के लिए cached batch job सबसे सस्ता तरीका है।
इसके बदले में आपको latency से समझौता करना पड़ता है, जो batch को किसी भी ऐसे कार्य के लिए अनुपयुक्त बनाता है जिसके लिए कोई व्यक्ति प्रतीक्षा कर रहा हो। यह overnight classification और document backfills के लिए उपयुक्त है।
एक ही conversation के भीतर chat की लागत क्यों बढ़ती है
चूंकि API कोई state नहीं रखती है, इसलिए आपका client हर turn पर पूरी conversation को फिर से भेजता है। इस कारण एक ही chat के भीतर token का उपयोग सीधी रेखा में बढ़ने के बजाय उसकी लंबाई के वर्ग (square) के अनुपात में बढ़ता है।
मान लीजिए कि हर turn औसतन 500 tokens का है। Turn 1 में 500 input tokens भेजे जाते हैं। Turn 2 में 1,000 tokens भेजे जाते हैं। Turn 20 तक यह संख्या 10,000 हो जाती है। यदि आप n(n+1)/2 के सूत्र से इसका योग निकालें, तो 20 turns की एक conversation में लगभग 105,000 input tokens भेजे जा चुके होंगे, जबकि transcript की वास्तविक लंबाई केवल 10,000 tokens ही है।
यही कारण है कि chat feature की लागत transcript से कहीं अधिक होती है, और लंबी threads पर stable prefix को cache करना या पुराने turns का सारांश (summarise) बनाना किफायती साबित होता है। Tool calls को बार-बार दोहराने वाले agent के साथ भी यही स्थिति होती है, बल्कि यह और भी गंभीर है: हर tool का परिणाम history में बना रहता है और बाद के हर turn पर फिर से भेजा जाता है। अपने द्वारा चलाए जा रहे agent पर खर्च की सख्त सीमा तय करना यहाँ सबसे महत्वपूर्ण है, क्योंकि यह वृद्धि स्वचालित रूप से होती है और इस पर किसी का ध्यान नहीं रहता।
अनुमान लगाने से पहले टोकन की गणना करें
शब्दों की संख्या के आधार पर टोकन की संख्या का अनुमान लगाना बंद करें। API आपके लिए बिना किसी शुल्क के, संदेश निर्माण से अलग एक रेट लिमिट पर इनकी गणना करता है।
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{
"role": "user",
"content": "Hello, Claude"
}]
}'रिस्पॉन्स में एक फील्ड होता है:
{ "input_tokens": 14 }इसमें अपना वास्तविक सिस्टम प्रॉम्प्ट और टूल डेफिनिशन डालें, साथ ही एक प्रतिनिधि यूजर मैसेज भी दें, और फिर संख्या को ऊपर दिए गए कॉस्ट फंक्शन में डालें। एंडपॉइंट वही बॉडी लेता है जो एक मैसेज रिक्वेस्ट लेती है, इसलिए इमेज और PDF की गणना भी सही ढंग से होती है। दो सावधानियां महत्वपूर्ण हैं। यह गणना एक अनुमान है और बिल की गई संख्या से थोड़ी भिन्न हो सकती है। इसे उस मॉडल के टोकेनाइज़र के साथ मापा जाता है जिसे आप पास करते हैं, इसलिए वही मॉडल पास करें जिसे आप वास्तव में चलाएंगे।
आउटपुट टोकन की गणना पहले से नहीं की जा सकती, क्योंकि वे अभी मौजूद नहीं हैं। उन्हें max_tokens के साथ कैप करें, और फिर लाइव ट्रैफिक पर usage.output_tokens से वास्तविक वितरण को मापें।
बिल में और क्या शामिल होता है
बिल का अधिकांश हिस्सा टोकन से बनता है। कुछ आइटम टोकन नहीं होते हैं, और वे लोगों को आश्चर्यचकित करते हैं।
- टूल डेफिनिशन हर रिक्वेस्ट पर इनपुट टोकन बन जाते हैं। केवल टूल यूज़ सिस्टम प्रॉम्प्ट ही Opus 5 पर आपके अपने स्कीमा से पहले 286 से 406 टोकन जोड़ देता है। दस विस्तृत टूल विवरण एक छोटे प्रॉम्प्ट को दोगुना कर सकते हैं।
- वेब सर्च पर $10 प्रति 1,000 सर्च का शुल्क लगता है, जो उन टोकन के अतिरिक्त है जो परिणाम संदर्भ (context) में प्रवेश करने पर उपभोग करते हैं।
- वेब फेच का अपना कोई शुल्क नहीं है, लेकिन फेच किया गया पेज इनपुट टोकन बन जाता है। 100 kB का डॉक्यूमेंटेशन पेज लगभग 25,000 टोकन का होता है।
- Claude 4.6 और बाद के वर्ज़न पर
inference_geoके साथ केवल US-आधारित इन्फरेंस (inference) का अनुरोध करने पर हर टोकन श्रेणी पर 1.1 का मल्टीप्लायर लागू होता है, जिसमें कैश रीड और राइट भी शामिल हैं।
क्या API खरीदना सही निर्णय है, यह पूरी तरह से आपके वॉल्यूम पर निर्भर करता है। किसी प्लान पर उपयोग की सीमा (usage ceiling) तक पहुँचना ही आमतौर पर इस प्रश्न को जन्म देता है, और सीमा से बाहर निकलने के रास्ते प्रतीक्षा करने से लेकर उस कार्य को मीटर्ड API कॉल्स पर ले जाने तक हो सकते हैं। उपयोग के एक निश्चित स्तर से नीचे, फ्लैट मासिक प्लान पूरी तरह से बेहतर रहता है, और Claude सब्सक्रिप्शन के मुकाबले API वास्तविक आंकड़ों के साथ उस तुलना को प्रस्तुत करता है।
FAQ
Claude में 1M tokens की कीमत कितनी है?
यह मॉडल पर और इस बात पर निर्भर करता है कि tokens input हैं या output। अगस्त 2026 तक, Claude Haiku 4.5 पर दस लाख input tokens की कीमत $1 है, Claude Sonnet 5 पर शुरुआती pricing के तहत $2 है, और Claude Opus 5 पर $5 है। प्रत्येक मॉडल पर output की कीमत input दर से पांच गुना अधिक है। 1 सितंबर 2026 से Sonnet 5 की कीमत $3 input और $15 output हो जाएगी। दरें बदलती रहती हैं, इसलिए बजट तय करने से पहले आधिकारिक pricing page पर उनकी पुष्टि जरूर कर लें।
क्या 1M tokens और 1M शब्द एक ही हैं?
नहीं। एक token लगभग 4 अंग्रेजी अक्षरों या लगभग 0.75 शब्दों के बराबर होता है, इसलिए दस लाख tokens लगभग 750,000 शब्दों के बराबर हैं। यह अनुपात केवल एक अनुमान है। Code, JSON और अंग्रेजी के अलावा अन्य भाषाओं में प्रति शब्द अधिक tokens का उपयोग होता है। Claude Opus 4.7 और उसके बाद के संस्करण एक नए tokenizer का उपयोग करते हैं जो समान text के लिए Claude Sonnet 4.6 और उससे पुराने संस्करणों की तुलना में लगभग 30 प्रतिशत अधिक tokens उत्पन्न करता है, इसलिए गणनाएं अलग-अलग मॉडल पीढ़ियों के बीच समान नहीं रहती हैं। जिस मॉडल का आप उपयोग करने की योजना बना रहे हैं, उसे पास करके मुफ्त /v1/messages/count_tokens endpoint के साथ मापें।
क्या prompt caching हमेशा पैसे बचाता है?
नहीं। 5 मिनट का cache write आधार input दर का 1.25 गुना खर्च करता है, इसलिए एक ऐसा prefix जिसे लिखा तो जाता है लेकिन कभी पढ़ा नहीं जाता, वह सामान्य रूप से भेजने की तुलना में 25 प्रतिशत अधिक महंगा पड़ता है। यह पहली बार पढ़ने के बाद ही अपना खर्च वसूल कर लेता है। यह दो तरह से विफल होता है, और दोनों ही बार कोई सूचना नहीं मिलती। यदि अनुरोधों के बीच cached prefix बदल जाता है, तो lookup कभी match नहीं होता, क्योंकि यह एक सटीक prefix match है। यदि prefix मॉडल की न्यूनतम cacheable लंबाई से छोटा है (जो Sonnet 5 पर 1,024 tokens और Haiku 4.5 पर 4,096 tokens है), तो कुछ भी cache नहीं होता और कोई error भी नहीं मिलता। जब cache_creation_input_tokens और cache_read_input_tokens दोनों 0 पढ़ते हैं, तो cache का कोई उपयोग नहीं हो रहा है।
मेरा बिल मेरे message count की तुलना में तेजी से क्यों बढ़ा?
क्योंकि हर बार पूरी बातचीत फिर से भेजी जाती है। Messages API में कोई state नहीं होती, इसलिए chat के 20वें चरण में पिछले सभी 19 चरण फिर से input के रूप में जाते हैं। यदि प्रत्येक चरण औसतन 500 tokens का है, तो 20 चरणों की बातचीत में लगभग 105,000 input tokens भेजे जाते हैं, जबकि transcript केवल 10,000 tokens लंबा होता है। Agent loops भी इसी तरह काम करते हैं, क्योंकि हर tool का परिणाम history में बना रहता है। स्थिर prefix को cache करें, या पुराने चरणों का सारांश (summarise) बनाएं और उन्हें अनुरोध से हटा दें।