SSD Nodes Learn 🎉 VPS $4.99/माह से
गाइड Matt Connorलेखक: Matt Connor

Claude Fable 5 की कीमत और इसे कब इस्तेमाल करें

Claude Fable 5 की दर $10 प्रति million input tokens और $50 प्रति million output tokens है। प्रकाशित pricing से जानें कि आपके वास्तविक jobs पर यह लागत कैसे लागू होती है।

Claude Fable 5 की कीमत क्या है?

Claude API पर Claude Fable 5 की कीमत input tokens के लिए प्रति million $10 और output tokens के लिए प्रति million $50 है। ये Anthropic की प्रकाशित list rates हैं, जिन्हें 3 August 2026 को pricing page से लिया गया था। API model ID claude-fable-5 है। यह 9 June 2026 को Claude API, Amazon Bedrock, Claude Platform on AWS, Google Cloud और Microsoft Foundry पर आम तौर पर उपलब्ध हुआ।

ChartPublished Claude API list prices, US dollars per million tokens, checked 3 August 2026
The data behind this chart
[
  {
    "label": "Claude Fable 5",
    "input": "10",
    "output": "50",
    "cache_read": "1",
    "batch_input": "5",
    "batch_output": "25"
  },
  {
    "label": "Claude Opus 5",
    "input": "5",
    "output": "25",
    "cache_read": "0.50",
    "batch_input": "2.50",
    "batch_output": "12.50"
  },
  {
    "label": "Claude Sonnet 5 (intro rate)",
    "input": "2",
    "output": "10",
    "cache_read": "0.20",
    "batch_input": "1",
    "batch_output": "5"
  },
  {
    "label": "Claude Sonnet 5 (from 1 Sep)",
    "input": "3",
    "output": "15",
    "cache_read": "0.30",
    "batch_input": "1.50",
    "batch_output": "7.50"
  },
  {
    "label": "Claude Haiku 4.5",
    "input": "1",
    "output": "5",
    "cache_read": "0.10",
    "batch_input": "0.50",
    "batch_output": "2.50"
  }
]

इसे एक क्रम के रूप में समझें। Fable 5 की list price Claude Opus 5 से दोगुनी, वर्तमान Claude Sonnet 5 rate से पांच गुनी और Claude Haiku 4.5 से दस गुनी है। दोनों प्रकार के tokens के लिए ratio समान है, क्योंकि उस chart में हर model अपने input rate के ठीक पांच गुना output price रखता है। इसलिए यदि किसी job में input और output tokens का विभाजन ज्ञात है, तो multiplication से एक price को किसी अन्य price में बदला जा सकता है।

एक तारीख से गणना बदल जाती है। 31 August 2026 तक Sonnet 5 पर introductory pricing लागू है: प्रति million tokens के लिए $2 input और $10 output। 1 September 2026 से इसकी list price $3 input और $15 output होगी। Fable 5 की अपनी price नहीं बदलेगी, इसलिए उस दिन दोनों के बीच का अंतर पांच गुना से घटकर तीन गुना से कुछ अधिक रह जाएगा। यदि आप autumn के लिए budget तैयार कर रहे हैं, तो Sonnet की बाद वाली rates का उपयोग करें।

छूट, और वह एक multiplier जो लागत बढ़ाता है

Prompt caching सबसे बड़ा प्रभाव डालता है। Cache read की लागत base input price की दसवीं हिस्सेदारी है, यानी Fable 5 पर प्रति million tokens $1। Cache में लिखने की लागत सामान्य input token से अधिक होती है: five minute cache के लिए base का 1.25 गुना और one hour cache के लिए base का 2 गुना। Five minute cache एक read के बाद अपनी लागत निकाल लेता है, जबकि one hour cache दो reads के बाद। यही गणना इस बात का पूरा आधार है कि हर जगह इसे enable करने से पहले prompt caching का break-even बिंदु निकालना क्यों जरूरी है।

Batch API दोनों पक्षों पर 50% की छूट देता है, इसलिए batched Fable 5 work की लागत प्रति million tokens $5 और $25 होती है। Batch requests asynchronous होती हैं, इसलिए इसका लाभ केवल ऐसे work में मिलता है जिसे तुरंत उत्तर की आवश्यकता नहीं होती। दोनों छूट एक साथ लागू होती हैं, जिससे cached, batched job में input और output दोनों की लागत कम हो जाती है।

1M token context window Claude 4.6 और बाद के models में standard rates के अंतर्गत शामिल है। Long context surcharge नहीं है, इसलिए 900k token request की प्रति token दर 9k token request जितनी ही होती है।

जो multiplier bill बढ़ाता है, वह data residency है। Inference को United States के भीतर रखने के लिए inference_geo: "us" सेट करने पर cache reads और cache writes सहित हर token category पर 1.1 गुना multiplier लागू होता है। जब तक कोई contract इसकी मांग न करे, default global routing को लागू रहने दें।

इस model के लिए एक billing rule विशिष्ट है। Fable 5 ऐसे safety classifiers के साथ ship होता है जो किसी request को decline कर सकते हैं। ऐसा होने पर Messages API error के बजाय stop_reason: "refusal" को सफल HTTP 200 response के रूप में लौटाता है, और यदि कोई output generate होने से पहले request refuse कर दी जाती है, तो आपसे उसका bill नहीं लिया जाता। यदि आप उसी prompt को किसी अन्य Claude model पर retry करते हैं, तो fallback credit switch की prompt cache cost को refund कर देता है। इसलिए उसी cache को दो बार warm करने का भुगतान नहीं करना पड़ता।

कौन-से plans में Claude Fable 5 शामिल है?

3 August 2026 तक, Anthropic के Claude Fable पेज के अनुसार यह model Pro, Max, Team और Enterprise users के लिए उपलब्ध है। Free plan का नाम नहीं दिया गया है। Developers के लिए यह Claude API और ऊपर सूचीबद्ध cloud marketplaces पर सामान्य रूप से उपलब्ध है।

किसी plan पर उपलब्ध होना, बिना सीमा के शामिल होने के समान नहीं है। Anthropic के pricing पेज की plan comparison table कुछ seats पर Fable को weekly usage limits के एक हिस्से के पीछे और अन्य seats पर usage credits के पीछे रखती है। July 2026 के दौरान यह व्यवस्था एक से अधिक बार बदली। Fable 5 को फिर से deploy करने के बारे में Anthropic के अपने बयान में Pro, Max, Team और कुछ Enterprise plans के लिए 7 July 2026 तक weekly usage limits के अधिकतम 50% तक model शामिल था। इसके बाद usage credits लागू हुए। July के बाकी समय की reports में आगे के extensions और seat types के बीच अलग-अलग व्यवस्था बताई गई।

इसलिए यह पेज प्रति plan limit प्रकाशित नहीं करेगा। उस महीने प्रकाशित कोई भी figure 2 weeks तक स्थिर नहीं रही। यहां पुरानी संख्या देना, कोई संख्या न देने से भी खराब होगा। जिस दिन आप निर्णय लें, उस दिन plan comparison table में Fable नाम वाली row खोलें। किसी news article में दी गई संख्या को पुरानी मानें।

API rate स्थिर है। हर route पर included allowance समाप्त होने के बाद Fable 5 का अतिरिक्त usage ऊपर दिए गए chart में लागू prices के अनुसार bill होता है। इसलिए दोनों स्थितियों में planning के लिए price list ही आधार संख्या है। यही निष्कर्ष आप किसी अन्य Claude model के लिए API billing की तुलना subscription से करते समय भी निकालेंगे। यदि आपने अभी तक tier नहीं चुना है, तो देखें कि कौन-सा Claude plan आपके usage के अनुरूप है

आपका बिल price ratio से अधिक क्यों आता है

दो documented mechanisms के कारण Fable 5 की लागत सीधी price comparison से अनुमानित लागत से अधिक होती है।

पहला mechanism tokenizer है। Fable 5, Claude Opus 4.7 के साथ पेश किया गया tokenizer इस्तेमाल करता है। Opus 4.7 से पहले released models की तुलना में वही text लगभग 30% अधिक tokens बनाता है। वास्तविक वृद्धि content पर निर्भर करती है। Haiku 4.5 इस tokenizer से पहले का model है। इसलिए price list में दस गुना का अंतर, दोनों models को वही text देने पर लगभग तेरह गुना हो जाता है। Sonnet 5 नया tokenizer इस्तेमाल करता है। इसलिए Fable और Sonnet के बीच per-token comparison उचित है। Fable और Haiku के बीच ऐसा comparison उचित नहीं है।

दूसरा कारण thinking है। Fable 5 में adaptive thinking हमेशा enabled रहती है और thinking: {"type": "disabled"} supported नहीं है। Thinking tokens को output tokens के रूप में, पूरी output rate पर, bill किया जाता है। इस model पर raw chain of thought कभी return नहीं की जाती। thinking.display का default "omitted" है। इसका अर्थ है कि छोटा visible answer भी billed output count को काफी बढ़ा सकता है। Anthropic के documentation में यह स्पष्ट लिखा है: billed output token count, response में दिखाई देने वाले token count से मेल नहीं खाता।

अनुमान लगाने के बजाय breakdown देखें। usage.output_tokens_details.thinking_tokens field बताता है कि कितने billed output tokens reasoning पर खर्च हुए:

{
  "usage": {
    "input_tokens": 25,
    "output_tokens": 348,
    "output_tokens_details": {
      "thinking_tokens": 312
    }
  }
}

Anthropic के thinking documentation से लिए गए उस example में 348 billed output tokens में से 312 ऐसी reasoning के थे जिन्हें किसी ने नहीं देखा। जब आप stream करते हैं, तो यह breakdown केवल अंतिम message_delta event पर आता है। इसलिए जो client अंतिम text chunk पर पढ़ना बंद कर देता है, वह इसे कभी record नहीं करेगा।

इसका control effort है। इसे output_config.effort पर set किया जाता है और इसके levels low, medium, high (default), xhigh और max हैं।

{
  "model": "claude-fable-5",
  "max_tokens": 32000,
  "output_config": { "effort": "medium" },
  "messages": [{ "role": "user", "content": "..." }]
}

इस model के लिए Anthropic का guidance है कि शुरुआत high से करें। केवल सबसे अधिक capability sensitive work के लिए xhigh तक बढ़ाएँ। Routine work के लिए medium या low तक कम करें। इसका कारण यह है कि Fable 5 में कम effort अक्सर पुराने models पर xhigh से बेहतर परिणाम देता है। इसके साथ दो समस्याएँ हैं। Requests के बीच effort बदलने पर आपका prompt cache invalid हो जाता है, क्योंकि resolved effort value prompt में render की जाती है। इसलिए प्रत्येक workload के लिए एक level चुनें और उसे स्थिर रखें। दूसरा, max_tokens कुल output पर hard cap है। इसमें thinking और response text दोनों शामिल हैं। इसलिए बिना thinking वाले answer के लिए तय किया गया cap response को truncate कर सकता है। stop_reason: "max_tokens" दिखने का अर्थ है कि आपको cap बढ़ाना होगा या effort कम करना होगा।

प्रति पूर्ण कार्य लागत, प्रति token लागत नहीं

ChartCost of one job in US dollars, worked from published rates and assumed token volumes
The data behind this chart
[
  {
    "label": "Short answer (5k in, 1k out)",
    "fable_5": "0.10",
    "opus_5": "0.05",
    "sonnet_5": "0.02",
    "haiku_4_5": "0.01"
  },
  {
    "label": "Coding session (300k in, 40k out)",
    "fable_5": "5.00",
    "opus_5": "2.50",
    "sonnet_5": "1.00",
    "haiku_4_5": "0.50"
  },
  {
    "label": "Long agent run (2M in, 400k out)",
    "fable_5": "40.00",
    "opus_5": "20.00",
    "sonnet_5": "8.00",
    "haiku_4_5": "4.00"
  }
]

वे 3 rows केवल arithmetic हैं, benchmark नहीं। Rates प्रकाशित हैं। Token volumes assumptions हैं; इन्हें अपने usage data के आँकड़ों से बदलें। बीच वाली row जैसी coding session की लागत Fable 5 पर $5.00 और Sonnet 5 पर $1.00 है। लंबी run की लागत $40.00 और $8.00 है। आखिरी row में Haiku column केवल arithmetic है: Haiku 4.5 की context window 200k tokens की है, इसलिए वह इस job को बिल्कुल hold नहीं कर सकता।

निर्णय के लिए प्रति token लागत सही unit नहीं है। प्रति पूर्ण कार्य लागत, प्रति प्रयास लागत को प्रयासों की संख्या से गुणा करने पर मिलती है। आज की rates पर Fable 5 का एक attempt, Sonnet 5 के पाँच attempts के बराबर खर्च होता है, इसलिए केवल retry count upgrade को लगभग कभी उचित नहीं ठहराता। Tokens के हिसाब से सस्ता विकल्प हारने से पहले Sonnet को पाँच में से चार से अधिक बार fail होना पड़ेगा।

Upgrade को उचित ठहराने वाली चीजें वे हैं जिन्हें token bill में शामिल नहीं किया जाता। Chart में दोनों लंबी runs के बीच का अंतर अधिकांश markets में engineer के एक घंटे के समय से कम है। यदि महंगा model review में एक घंटा बचाता है या ऐसी एक खराब migration से बचाता है जिसे बाद में आपको ठीक करना पड़े, तो उसने अपनी लागत वसूल कर ली है, भले ही bill में यह बचत दिखाई न दे। तुलना accepted result की money per unit में करें और total में अपना समय भी शामिल करें। यह जानना कि वास्तव में एक million tokens से क्या मिलता है इस estimate को काफी कम abstract बनाता है।

तीन काम, जिनमें Claude Fable 5 की कीमत उचित है

ऐसे लंबे agent runs, जिनमें गलत दिशा चुनना महंगा पड़ता है। Fable 5 को घंटों में मापे जाने वाले काम के लिए बनाया गया है: इसमें 1M token context window, प्रति request अधिकतम 128k output tokens और xhigh effort level है। यह ऐसे tasks के लिए है जो तीस मिनट से अधिक चलते हैं और जिनमें token budget millions में होता है। Run की लागत की तुलना उस cleanup से करें, जो agent के step 40 पर गलत branch लेने के बाद करना पड़ेगा, जबकि किसी को इसका पता step 300 तक न चले।

किसी बड़े codebase पर एक बार चलाया जाने वाला migration या audit। One-off काम में लागत को volume के आधार पर फैलाने का अवसर नहीं होता। इसलिए per-token premium एक ही invoice पर आता है और पूरा काम एक context window में समा सकता है। यदि इसे asynchronous तरीके से चलाया जा सकता है, तो Batch API इसकी लागत घटाकर प्रति million output tokens $25 कर देता है।

वह task, जिसमें सस्ता model पहले ही दो बार विफल हो चुका है। दो विफल attempts और आपका debugging time ऊपर दिए गए chart के volumes पर एक Fable attempt से अधिक महंगे पड़ते हैं। Escalate करना अधिक सस्ता विकल्प है, और model ladder का उद्देश्य यही है। यदि आप अभी भी सामान्य रूप से tiers के बीच चयन कर रहे हैं, तो Claude model tiers के capability comparison उस प्रश्न का उत्तर देता है, जिसका उत्तर यह page नहीं देता।

तीन कामों में Sonnet 5 या Haiku 4.5 ही सही विकल्प हैं

बड़ी मात्रा में classification और extraction। इन कामों का मूल्यांकन throughput और प्रति-इकाई लागत के आधार पर होता है, और quality ceiling इतनी कम होती है कि सस्ता model ही उस स्तर तक पहुँच जाता है। जिस task को Haiku 4.5 सही ढंग से पूरा करता है, उसके लिए दस गुना कीमत चुकाने पर Fable 5 से ऐसा कोई मापने योग्य लाभ नहीं मिलता।

ऐसा interactive work जिसमें latency ही मुख्य अनुभव है। Anthropic की model table में Fable 5 की comparative latency धीमी दी गई है, और thinking को बंद नहीं किया जा सकता। अधिक सक्षम model पर chat box या editor completion का अनुभव खराब लगता है, क्योंकि users पहले wait time महसूस करते हैं और quality बाद में।

ऐसा कोई भी काम जो January 2026 के बाद की घटनाओं पर निर्भर हो। Fable 5 का reliable knowledge cutoff January 2026 है। Opus 5 का cutoff May 2026 है। अधिक महँगा model कम current है। इसलिए recency वाले सवालों पर आप पुराने knowledge के लिए दोगुनी कीमत चुकाते हैं, जब तक कि उसे search या fetch tools न दिए जाएँ।

एक constraint पूरी तरह cost से अलग है। Fable 5 में 30 day data retention लागू है और यह zero data retention के अंतर्गत उपलब्ध नहीं है, क्योंकि इसे Covered Model के रूप में designated किया गया है। यदि आपके agreement में zero retention आवश्यक है, तो किसी भी कीमत पर Fable 5 विकल्प नहीं है। कोई discount भी यह स्थिति नहीं बदलता।

fable-method repos क्या दिखाते हैं और क्या नहीं

Practitioners ने ऐसे repositories प्रकाशित किए हैं जो Fable 5 के काम करने के तरीकों को संक्षेप में skills के रूप में प्रस्तुत करते हैं, ताकि कोई कम महंगा model उनका पालन कर सके। fable-method repo में एक thinking skill, एक orchestration loop और एक adversarial verifier का वर्णन है। यह verifier agent की अपनी report पढ़ने के बजाय हर दावे किए गए check को फिर से चलाता है। इसके README में यह बात सीधे कही गई है: "यह community distillation है, Anthropic artifact नहीं।"

इसे ठीक इसी रूप में लें। यह इस बात का evidence है कि लोग model को किस तरह चला रहे हैं। यह इस बात का documentation नहीं है कि model कैसे काम करता है। इसमें कोई भी बात Anthropic द्वारा validate नहीं की गई है। इसके कई लगभग समान forks अलग-अलग wording के साथ मौजूद हैं। यह specification के बजाय folklore से अपेक्षित स्थिति है।

Cost decision के लिए उपयोगी signal यह है कि लोगों ने जिन हिस्सों को copy करना उचित समझा, वे procedural हैं। Task को classify करें। वह check निर्धारित करें जो साबित करे कि task पूरा हो गया है। निर्णय लेने से पहले evidence एकत्र करें। फिर summary पढ़कर नहीं, बल्कि observation से verify करें। कम महंगे model को explicit checklist और verification step देने से यह gap कुछ हद तक कम हो जाता है। इसलिए महंगे model को standard बनाने से पहले अपने evaluation set पर यह experiment चलाएँ। परिणाम आपके tasks पर निर्भर करता है। इसी कारण किसी अन्य व्यक्ति की संख्या आपके लिए अधिक उपयोगी नहीं है।

बजट तय करने से पहले अपने आंकड़े जाँचें

  • हर response में usage पढ़ें और output_tokens_details.thinking_tokens को visible output से अलग log करें। जो reasoning आपको दिखाई नहीं देती, वही अक्सर अप्रत्याशित खर्च का कारण बनती है।
  • effort को स्पष्ट रूप से सेट करें। Default स्वीकार न करें। Prompt caching पर निर्भर किसी भी conversation में इसका मान स्थिर रखें।
  • पहले अपने stable prefix को cache breakpoint के पीछे रखें। Base input price के one tenth पर होने वाला cache read, अधिकांश model downgrades से अधिक बचत करता है।
  • जिस सामग्री के लिए तत्काल उत्तर आवश्यक नहीं है, उसे Batch API में भेजें।
  • विकल्प की लागत का ईमानदारी से आकलन करें। अपने workload पर Claude और ChatGPT API pricing की तुलना करने में लंबी अवधि की प्रतिबद्धता से पहले एक दोपहर लगाना उपयोगी है।

यदि workload आपके अपने server पर चलने वाला agent है, तो सबसे महत्वपूर्ण controls model choice के बाहर होते हैं। VPS पर agent की लागत नियंत्रित रखना उन loop limits और spend caps को समझाता है जो runaway session को रोकते हैं, और Claude Code वास्तव में tokens कहाँ खर्च करता है आपके usage dashboard में दिखाई देने वाले आंकड़ों को स्पष्ट करता है।

FAQ

Claude Fable 5 की कीमत प्रति मिलियन tokens कितनी है?

Claude API पर Claude Fable 5 की कीमत प्रति मिलियन input tokens $10 और प्रति मिलियन output tokens $50 है। यह कीमत Anthropic के pricing page पर 3 August 2026 को जाँची गई थी। Cache read की कीमत प्रति मिलियन tokens $1 है, जो base input rate का दसवाँ हिस्सा है। Batch API दोनों दरों पर 50% की छूट देता है। इससे asynchronous work के लिए कीमतें प्रति मिलियन tokens $5 और $25 हो जाती हैं। inference_geo parameter के साथ inference को United States के भीतर रखने पर हर category पर 1.1 times multiplier लागू होता है।

क्या Claude Fable 5, Claude Pro subscription में शामिल है?

Anthropic के Claude Fable page पर यह model Pro, Max, Team और Enterprise users के लिए उपलब्ध बताया गया है। Free plan का नाम वहाँ नहीं दिया गया है। Included access unlimited नहीं है। कुछ seats में Fable weekly usage limits के एक हिस्से के रूप में उपलब्ध होता है। अन्य seats में यह usage credits के माध्यम से उपलब्ध होता है। यह व्यवस्था July 2026 के दौरान एक से अधिक बार बदली थी। जिस दिन आप निर्णय लें, उस दिन Anthropic के pricing page पर plan comparison table में Fable वाली row पढ़ें। किसी article में दिए गए आँकड़े पर निर्भर न रहें। Included allowance समाप्त होने के बाद अतिरिक्त usage पर API rate के अनुसार bill आता है।

दिखाई देने वाले output की तुलना में मेरा Claude Fable 5 bill अधिक क्यों है?

Claude Fable 5 में adaptive thinking हमेशा on रहता है। Thinking tokens पर output tokens के रूप में bill आता है। Raw chain of thought कभी return नहीं होती। thinking.display को उसके default omitted पर रखने पर आपको खाली thinking field दिखाई देती है, जबकि उसके पीछे इस्तेमाल हुए हर reasoning token का bill आता है। Response में usage.output_tokens_details.thinking_tokens पढ़कर यह विभाजन देखें। Streaming के दौरान यह केवल अंतिम message_delta event पर आता है। यदि reasoning और answer का अनुपात task की आवश्यकता से अधिक है, तो effort level कम करें।

मुझे Claude Fable 5 इस्तेमाल करना चाहिए या Claude Opus 5?

Claude Opus 5 की प्रति token कीमत आधी है। इसका reliable knowledge cutoff भी अधिक recent है: Claude Opus 5 के लिए May 2026 और Fable 5 के लिए January 2026। पहले Opus 5 पर काम शुरू करें। यदि वहाँ task fail हो या गलत answer की लागत price difference से अधिक हो, तो Fable 5 पर जाएँ। Long horizon agent work के लिए Fable 5 बेहतर विकल्प है, जहाँ एक गलत branch को ठीक करने में कई घंटे लग सकते हैं। यह उन one off jobs के लिए भी उपयुक्त है, जिनमें premium हर request पर हमेशा लगने के बजाय एक ही invoice में शामिल होता है।

#claude#fable#model-selection#pricing#tokens