Claude बनाम ChatGPT API: किसकी कीमत कम है?
Claude और ChatGPT API की लागत हर workload में अलग है। token गणना, तीन वास्तविक costed jobs और वह tier-specific फर्क जानें जहाँ Claude bill कई गुना बढ़ता है।
संक्षिप्त उत्तर
Claude बनाम ChatGPT API की कीमतों में कोई एक स्पष्ट विजेता नहीं है, क्योंकि दोनों विक्रेता हर tier पर input और output की अलग-अलग कीमत तय करते हैं। August 2026 तक Claude के ऊपरी दो tier, अपने OpenAI समकक्षों जितनी ही प्रति input token कीमत लेते हैं और प्रति output token कम कीमत लेते हैं। इसलिए output-heavy कार्यों में Claude थोड़ा आगे रहता है। छोटे tier में उसी कार्य के लिए Claude की लागत कई गुना अधिक है। जो उत्तर tier और token mix नहीं बताता, वह केवल अनुमान है।
इसलिए यह पृष्ठ पहले गणना देता है, फिर उनके token mix के साथ तीन लागत-निर्धारित workloads देता है, और अंत में उन multipliers को समझाता है जो headline rate की तुलना में वास्तविक bill को अधिक प्रभावित करते हैं।
केवल यही सूत्र आवश्यक है
दोनों APIs text के लिए एक ही तरह से शुल्क लेते हैं। आप अपने द्वारा भेजे गए tokens के लिए भुगतान करते हैं, और model द्वारा वापस लिखे गए tokens के लिए अधिक दर का भुगतान करते हैं।
cost = (input tokens / 1,000,000) * input rate + (output tokens / 1,000,000) * output rate
एक token में English के लगभग 4 characters होते हैं, जो किसी word के लगभग 0.75 के बराबर है। इसका उपयोग केवल शुरुआती अनुमान के लिए करें। वास्तविक bill के लिए प्रत्येक response के usage object में API द्वारा लौटाई गई counts का उपयोग करें।
# Rates are US dollars per million tokens.
def cost(in_tok, out_tok, in_rate, out_rate):
return in_tok / 1e6 * in_rate + out_tok / 1e6 * out_rate
# One support-chat turn: 1,400 tokens in, 220 tokens out, on a $2 / $10 model.
print(round(cost(1400, 220, 2.0, 10.0), 6))Script 0.005 print करती है, जो प्रत्येक turn के लिए आधा cent है। इसे एक महीने में अपेक्षित turns की संख्या से multiply करें और आपके पास budget होगा। इस एक सूत्र को सीख लें। आज के बाद होने वाला प्रत्येक price change नई analysis के बजाय केवल एक-line edit बन जाएगा।
प्रकाशित दरें, August 2026
ये वे सूचीबद्ध कीमतें हैं जिन्हें दोनों विक्रेताओं ने 1 August 2026 को प्रकाशित किया था। इस पोस्ट में कीमत लिखे जाने का यह एकमात्र स्थान है। बजट तय करने से पहले इसे claude.com/pricing और OpenAI के pricing page से जाँच लें।
The data behind this chart
[
{
"label": "Frontier",
"claude_input": 5,
"claude_output": 25,
"openai_input": 5,
"openai_output": 30
},
{
"label": "Workhorse",
"claude_input": 2,
"claude_output": 10,
"openai_input": 2,
"openai_output": 12
},
{
"label": "Workhorse from September",
"claude_input": 3,
"claude_output": 15,
"openai_input": 2,
"openai_output": 12
},
{
"label": "Small",
"claude_input": 1,
"claude_output": 5,
"openai_input": 0.2,
"openai_output": 1.2
}
]यह मिलान प्रत्येक lineup में स्थिति के आधार पर है, प्रसिद्धि के आधार पर नहीं। Frontier में Claude Opus 5 का मुकाबला gpt-5.6-sol से है। Workhorse में Claude Sonnet 5 का मुकाबला gpt-5.6-terra से है। Small में Claude Haiku 4.5 का मुकाबला gpt-5.6-luna से है। दोनों विक्रेता इस block से ऊपर के tiers भी बेचते हैं, और OpenAI पुरानी generations को उनकी मूल दरों पर सूचीबद्ध रखता है। एक ओर के flagship की तुलना दूसरी ओर के budget model से करने पर ऐसा आंकड़ा मिलता है जिसका कोई अर्थ नहीं होता। अधिकांश प्रकाशित तुलनाओं को अपना headline इसी तरह मिलता है।
इस block में दो बातें स्पष्ट रूप से बतानी आवश्यक हैं। Sonnet 5 की 2 और 10 introductory rates हैं। Anthropic के दस्तावेज़ के अनुसार ये 31 August 2026 को समाप्त हो जाती हैं। इसके बाद Sonnet 5 के लिए 3 और 15 शुल्क लागू होते हैं। इस एक बदलाव से workhorse tier में Claude की मामूली बढ़त समाप्त होकर OpenAI की स्पष्ट बढ़त बन जाती है। यह बदलाव इस पोस्ट की उपयोगी अवधि के भीतर ही होगा।
दूसरी बात एक ऐसा pattern है जिसे याद रखना चाहिए: ऊपर की प्रत्येक row में Claude अपने input rate के ठीक 5 गुना output का मूल्य रखता है, जबकि OpenAI 6 गुना मूल्य रखता है। Absolute rate नहीं, बल्कि यही ratio तय करता है कि आपके token mix के अनुसार विजेता कौन होगा।
प्रति मिलियन टोकन दर की विभिन्न vendors के बीच तुलना क्यों नहीं की जा सकती
दर प्रति token डॉलर में होती है। बिल प्रति token डॉलर को tokens की संख्या से गुणा करने पर बनता है। किसी पाठ के लिए tokens की संख्या model की विशेषता होती है, पाठ की नहीं।
Anthropic इसे सीधे dokument करता है: Claude 4.7 और उसके बाद के models, जिनमें Claude Opus 5 और Claude Sonnet 5 शामिल हैं, एक नया tokenizer इस्तेमाल करते हैं। यह tokenizer उसी पाठ के लिए Claude Sonnet 4.6 और उससे पहले के models की तुलना में लगभग 30% अधिक tokens बनाता है। दर में बदलाव नहीं हुआ। बिल बदल गया।
इसलिए समान दिखने वाली दो दरों से दो समान बिल नहीं बनते। दोनों पक्षों के tokens को अपने पाठ के साथ गिनें। इसके बाद ही इस तुलना सहित किसी भी तुलना पर भरोसा करें।
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5",
"messages": [{"role": "user", "content": "Summarise the attached contract."}]
}'सही response एक छोटी JSON object होती है, जिसमें input_tokens होता है। 401 का अर्थ है कि आपके shell में key variable खाली है। उसी पाठ को दूसरे vendor के tokenizer से चलाएँ। एक count को दूसरे count से विभाजित करें। तुलना करने से पहले उस ratio को प्रकाशित दर में गुणा करें। यदि ratio किसी एक vendor के पक्ष में लगभग 1.2 से अधिक है, तो वह ऊपर दिए गए block में दरों के हर अंतर से अधिक महत्वपूर्ण है।
परिदृश्य एक: चैट सुविधा
एक web application के अंदर support assistant। हर महीने 120,000 turns। हर turn में एक system prompt, tool schemas, दो retrieved help-desk snippets और पहले के कुछ messages भेजे जाते हैं। इसमें लगभग 1,400 input tokens होते हैं और model लगभग 220 tokens में उत्तर देता है। यह interactive है, इसलिए batch discount यहां कभी लागू नहीं हो सकता। इसे workhorse tier पर चलाएं।
The data behind this chart
[
{
"label": "List price",
"claude_usd": "600.00",
"openai_usd": "652.80"
},
{
"label": "Cached prefix",
"claude_usd": "427.20",
"openai_usd": "480.00"
},
{
"label": "Small tier, cached",
"claude_usd": "213.60",
"openai_usd": "48.00"
}
]List price पर Claude का बिल 600.00 है, जबकि OpenAI का 652.80 है। Input legs समान हैं, क्योंकि input rates समान हैं। पूरा अंतर output का है, और Claude इसे इतने छोटे अंतर से जीतता है कि केवल इसके आधार पर vendor चुनना उचित नहीं है।
अब उन 1,400 input tokens में से 800 को stable prefix मानें: system prompt और tool schemas, जो turns के बीच नहीं बदलते। Cache hit के लिए दोनों vendors अपनी base input rate का 10% लेते हैं। Claude का बिल घटकर 427.20 और OpenAI का 480.00 हो जाता है। Caching का लाभ vendor के चुनाव से अधिक है, और दोनों platforms इसे उपलब्ध कराते हैं।
यहीं Claude पीछे रह जाता है। अधिकांश support answers के लिए workhorse model की आवश्यकता नहीं होती। उसी traffic को small tier पर ले जाएं। Claude का बिल 213.60, जबकि OpenAI का 48.00 होगा। एक को दूसरे से विभाजित करने पर पता चलता है कि उसी कार्य के लिए Claude की लागत लगभग साढ़े चार गुना अधिक है। Claude Haiku 4.5 प्रति million input tokens 1 लेता है, जबकि gpt-5.6-luna की दर 0.2 है। Caching की कोई मात्रा भी पांच गुना अंतर को समाप्त नहीं कर सकती। यदि आपका workload small model के अनुरूप है, तो OpenAI सस्ता है और अंतर बड़ा है।
परिदृश्य दो: लंबी-संदर्भ वाली दस्तावेज़ पाइपलाइन
हर महीने 25,000 अनुबंध। हर अनुरोध में वही 9,000-token निर्देश और JSON schema, उसके बाद 12,000 token का अनुबंध-पाठ होता है। फिर model लगभग 700 token के structured fields लौटाता है। इस कार्य में output कुल tokens के 4% से कम है। यही एक तथ्य तुलना का परिणाम तय करता है।
The data behind this chart
[
{
"label": "Chat feature",
"claude_usd": "427.20",
"openai_usd": "480.00"
},
{
"label": "Document pipeline",
"claude_usd": "820.00",
"openai_usd": "855.00"
},
{
"label": "Coding agent",
"claude_usd": "116.10",
"openai_usd": "124.20"
}
]दोनों पक्षों पर 9,000-token prefix cached होने पर, Claude का शुल्क 820.00 और OpenAI का शुल्क 855.00 है। Input की लागत cent तक समान है, क्योंकि August 2026 में दोनों की workhorse input rates समान हैं। पूरा अंतर output leg में है। Claude पर इसकी कीमत input की 5 गुना और OpenAI पर 6 गुना है।
इस कार्य में batching भी संभव है। दोनों vendors asynchronous work के लिए input और output पर 50% की छूट देते हैं। इसलिए दोनों totals आधे हो जाते हैं और अंतर का अनुपात बना रहता है। Batch किसी भी platform पर मिलने वाली सबसे बड़ी एकल छूट है। Nightly document pipeline हमेशा इसका उपयोग कर सकती है।
Claude का नुकसान पहले जैसी tier logic के कारण है। Fixed schema के आधार पर field extraction वही काम है जिसे small model अच्छी तरह करता है। यहाँ tokens का 97% input है। एक tier नीचे जाने पर OpenAI input rate 0.1 से गुणा होती है, जबकि Claude input rate 0.5 से गुणा होती है। बड़े model की आवश्यकता मान लेने से पहले 200 documents पर small model का परीक्षण करें। वही evaluation उपयोग करें जिसे आप किसी कार्य के लिए सही Claude tier चुनने के लिए चलाते।
परिदृश्य तीन: हमेशा सक्रिय coding agent
एक developer VPS पर एक agent चला रहा है, जिसमें हर महीने लगभग 900 model turns होते हैं। प्रत्येक turn में repository context के लगभग 60,000 input tokens होते हैं। इनमें से 80% cache hit होते हैं। Agent लगभग 1,800 tokens के edits और explanation तैयार करता है। इसकी कीमत frontier tier पर निर्धारित करें, क्योंकि coding में capability gap की वास्तविक लागत होती है।
Claude का बिल 116.10 है, जबकि OpenAI का बिल 124.20 है। Input rate समान है और cache read rate भी समान है। Claude का कम output rate लगभग 7% की बचत देता है।
यह 7% पहले के tokenizer error bar के भीतर है। इसलिए इस परिदृश्य में rates को बराबर मानें। जो बराबर नहीं है, वह billing model है। इस volume पर एक developer के लिए subscription seat की लागत आमतौर पर metered API calls से कम होती है। एक subscription seat शामिल करने पर पूरी तुलना बदल जाती है। किसी agent को metered billing पर चलाने से पहले API और subscription cost की तुलना के आधार पर इसका हिसाब करें। यदि आप usage को meter करते हैं, तो पहले पता करें कि tokens कहां खर्च हो रहे हैं। इसका कारण यह है कि coding agent का token usage उसके द्वारा लिखे गए code के बजाय प्रत्येक turn में दोबारा भेजे गए context से अधिक प्रभावित होता है।
बिल तय करने वाले गुणक
मुख्य दर इस सूची की सबसे छोटी लागत है। नीचे दिया गया प्रत्येक कारक समान tier पर दोनों vendors के बीच के अंतर से अधिक वास्तविक बिल को प्रभावित करता है।
कैश किया गया input। दोनों vendors cache hit के लिए base input का 10% लेते हैं। Anthropic cache लिखने के लिए भी शुल्क लेता है: पांच मिनट की entry के लिए base input का 1.25 गुना और एक घंटे की entry के लिए 2 गुना। बाद का hit उस entry को read price पर refresh करता है। इसलिए पांच मिनट की entry एक read के बाद अपनी लागत वसूल कर लेती है। जिन workloads में requests के बीच लंबा अंतराल होता है, उनमें reads की तुलना में writes अधिक बार होते हैं। ऐसे मामलों में caching से बचत के बजाय अधिक लागत आती है। स्थिर traffic में caching प्रभावी रहती है। अस्थिर traffic में नहीं।
Batch discounts। दोनों platforms पर input और output पर 50% की छूट मिलती है, लेकिन केवल asynchronous काम के लिए। यदि job को प्रतीक्षा करनी हो, तो किसी भी vendor पर बिल आधा हो जाता है। यह छूट caching के साथ भी लागू होती है।
Output का अनुपात। Claude output के लिए अपनी input rate का 5 गुना शुल्क लेता है। OpenAI 6 गुना शुल्क लेता है। आपके tokens में लिखे जाने वाले tokens का अनुपात जितना अधिक होगा, समान input rate पर Claude उतना ही बेहतर विकल्प होगा। Input-dominated काम में इसका उलटा होता है।
Retries। Retry में पूरा input फिर से भेजने का शुल्क लगता है और कोई उपयोगी output नहीं मिलता। यदि आपकी calls में से 6% schema validation में विफल होकर retry होती हैं, तो आपकी input लागत योजना में बताई गई लागत से 6% अधिक होगी। Retries को error line के बजाय cost line के रूप में log करें। Teams इस गुणक को सबसे अंत में पहचानती हैं। अक्सर यह उस vendor gap से बड़ा होता है जिस पर वे एक सप्ताह तक बहस करती रही होती हैं।
किस पक्ष को नुकसान होता है, और कहाँ
Claude छोटे स्तर पर पूरी तरह हारता है। gpt-5.6-luna की लागत प्रति 1 million input tokens 0.2 है, जबकि Claude Haiku 4.5 की लागत 1 है। Output की लागत क्रमशः 1.2 और 5 है। अधिक मात्रा वाले classification और छोटे extraction कार्य Claude पर लगभग चार गुना महंगे हैं।
1 September 2026 से Claude workhorse स्तर पर हारता है। उस दिन introductory rate समाप्त हो जाता है और Sonnet 5 की दर 3 तथा 15 हो जाती है। इस तुलना में gpt-5.6-terra की दर में कोई बदलाव नहीं होता। Frontier स्तर पर output rate के मामले में Claude आगे है, लेकिन आपके अपने token counts इस अंतर को समाप्त कर सकते हैं। August 2026 में input-dominated कार्यों में कोई पक्ष नहीं जीतता, क्योंकि दोनों पक्षों पर प्रति 1 million 2 की दर से input की लागत समान है।
अपने ट्रैफ़िक पर इसे कैसे मापें
हर response पर usage object पढ़ें और प्रत्येक request के लिए चार संख्याएँ store करें: input tokens, output tokens, cache read tokens और cache write tokens। Claude API में ये input_tokens, output_tokens, cache_read_input_tokens और cache_creation_input_tokens के रूप में मिलती हैं। इन्हें प्रतिदिन जोड़ें, वर्तमान rates से multiply करें और अपने total की invoice से तुलना करें। दोनों के बीच का अंतर आमतौर पर retries या उस code path के कारण होता है जिसे आपने deploy किया था लेकिन याद नहीं रहा।
तुलना sample prompt पर नहीं, बल्कि वास्तविक traffic के एक सप्ताह पर करें। Cost per token के बजाय cost per completed task की तुलना करें। जो model एक attempt में उत्तर देता है और जिसकी rate दोगुनी है, वह उस model से सस्ता है जिसे आधी rate पर तीन attempts चाहिए। Cost per token एक rate है। Cost per completed task आपका bill है।
कुछ भी running छोड़ने से पहले hard spend ceiling तय करें। दोनों platforms अपने consoles में spend limits देते हैं। Retry loop में फँसा agent रातोंरात एक महीने का budget खर्च कर सकता है। इसे उसी तरह configure करें जैसे आप हमेशा चालू agent पर cost control configure करते। यदि आप अपने स्वामित्व वाले server पर पहला version बना रहे हैं, तो VPS पर पहला Claude API app key handling और उस request loop को cover करता है जिस पर यह calculation आधारित है।
FAQ
क्या Claude API, ChatGPT API से सस्ता है?
हमेशा नहीं। August 2026 में दोनों सेवाओं के frontier और workhorse tiers में input token की कीमत समान है, जबकि Claude में output token की कीमत कम है। इसलिए output-heavy कार्यों पर Claude कुछ प्रतिशत सस्ता पड़ता है। small tier में OpenAI का gpt-5.6-luna, Claude Haiku 4.5 की तुलना में प्रति input token एक-पांचवें मूल्य का है। इसलिए high-volume classification OpenAI पर बहुत सस्ता है। अपना token mix लेकर स्वयं लागत निकालें। इतना छोटा अंतर आपके workload से तय होता है, price list से नहीं।
प्रत्येक API पर समान शब्दों के लिए tokens की संख्या अलग क्यों होती है?
क्योंकि प्रत्येक model का अपना tokenizer होता है और token count model की विशेषता होती है। Anthropic के दस्तावेज़ के अनुसार Claude 4.7 और उसके बाद के models, Claude Sonnet 4.6 और उससे पहले के models की तुलना में समान text के लिए लगभग 30% अधिक tokens बनाते हैं। अपना text प्रत्येक vendor के token counting endpoint पर भेजें। एक count को दूसरे से विभाजित करें। तुलना से पहले उस ratio को प्रकाशित rate में गुणा करें। 20% का token अंतर अधिकांश प्रकाशित rate differences से अधिक प्रभाव डालता है।
क्या prompt caching से कभी bill बढ़ सकता है?
हाँ, Anthropic पर। पाँच-minute entry के लिए cache write की लागत base input rate की 1.25 गुना और one-hour entry के लिए 2 गुना होती है, जबकि cache hit की लागत 0.1 गुना होती है। यदि आपका traffic इतना bursty है कि अधिकांश entries को पढ़े जाने से पहले expire हो जाती हैं, तो आप write premium चुकाते हैं और कोई read लाभ नहीं मिलता। अपने logs में cache_creation_input_tokens और cache_read_input_tokens की तुलना करें। 1 के निकट ratio का अर्थ है कि caching पर आपकी लागत बढ़ रही है। इसलिए entry की अवधि बढ़ाएँ या उसे हटा दें।
क्या coding agent को API पर चलाना चाहिए या subscription पर?
एक developer के सामान्य volume पर subscription seat की लागत आमतौर पर metered API billing से कम होती है। इसका कारण यह है कि coding agent प्रत्येक turn पर बड़ा context फिर से भेजता है और उस context के लिए हर बार शुल्क लिया जाता है। पहले एक सप्ताह तक इसकी माप करें। फिर API total की तुलना seat price से करें। जब usage spiky हो, या आपको programmatic access चाहिए जो seat उपलब्ध नहीं कराती, तब API अधिक लाभकारी होती है।