Claude Fable 5 کی قیمت اور اسے کب استعمال کریں
Claude Fable 5 کی قیمت $10 فی 1 million input tokens اور $50 فی 1 million output ہے۔ جانیں یہ شائع شدہ rates آپ کے حقیقی کاموں پر کیسے لاگو ہوتے ہیں۔
Claude Fable 5 کی قیمت کیا ہے؟
Claude Fable 5 کی قیمت Claude API پر ہر 1 million input tokens کے لیے $10 اور ہر 1 million output tokens کے لیے $50 ہے۔ یہ Anthropic کی شائع کردہ فہرستی قیمتیں ہیں، جو 3 August 2026 کو pricing page سے حاصل کی گئی تھیں۔ API model ID claude-fable-5 ہے۔ یہ 9 June 2026 کو Claude API، Amazon Bedrock، Claude Platform on AWS، Google Cloud اور Microsoft Foundry پر عام دستیابی کے لیے جاری ہوا۔
The data behind this chart
[
{
"label": "Claude Fable 5",
"input": "10",
"output": "50",
"cache_read": "1",
"batch_input": "5",
"batch_output": "25"
},
{
"label": "Claude Opus 5",
"input": "5",
"output": "25",
"cache_read": "0.50",
"batch_input": "2.50",
"batch_output": "12.50"
},
{
"label": "Claude Sonnet 5 (intro rate)",
"input": "2",
"output": "10",
"cache_read": "0.20",
"batch_input": "1",
"batch_output": "5"
},
{
"label": "Claude Sonnet 5 (from 1 Sep)",
"input": "3",
"output": "15",
"cache_read": "0.30",
"batch_input": "1.50",
"batch_output": "7.50"
},
{
"label": "Claude Haiku 4.5",
"input": "1",
"output": "5",
"cache_read": "0.10",
"batch_input": "0.50",
"batch_output": "2.50"
}
]اسے ایک سیڑھی کی طرح سمجھیں۔ Fable 5 کی فہرستی قیمت Claude Opus 5 سے دو گنا، موجودہ Claude Sonnet 5 کی شرح سے پانچ گنا، اور Claude Haiku 4.5 سے دس گنا ہے۔ یہ تناسب input اور output دونوں کی قیمتوں پر یکساں ہے، کیونکہ اس جدول میں ہر model اپنے input rate سے بالکل پانچ گنا output کی قیمت مقرر کرتا ہے۔ اس لیے اگر کسی کام کے input اور output tokens کا تناسب معلوم ہو تو ضرب کے ذریعے ایک model کی قیمت کو کسی دوسرے model کی قیمت میں تبدیل کیا جا سکتا ہے۔
ایک تاریخ سے حساب بدل جاتا ہے۔ 31 August 2026 تک Sonnet 5 کے لیے ابتدائی قیمت $2 اور $10 فی 1 million tokens ہے۔ 1 September 2026 سے اس کی فہرستی قیمت $3 اور $15 ہو جائے گی۔ Fable 5 کی اپنی قیمت تبدیل نہیں ہوگی، اس لیے اس دن دونوں کے درمیان فرق پانچ گنا سے کم ہو کر تین گنا سے کچھ زیادہ رہ جائے گا۔ اگر آپ autumn کے لیے budget تیار کر رہے ہیں تو Sonnet کی بعد والی قیمتیں استعمال کریں۔
رعایتیں، اور واحد ضرب جو لاگت بڑھاتی ہے
Prompt caching سب سے بڑا مالی فائدہ فراہم کرتا ہے۔ Cache read کی لاگت بنیادی input قیمت کا دسواں حصہ ہے۔ Fable 5 میں یہ فی ایک ملین tokens $1 ہے۔ Cache میں لکھنے کی لاگت عام input token سے زیادہ ہے: پانچ منٹ کے cache کے لیے بنیادی قیمت کا 1.25 گنا، اور ایک گھنٹے کے cache کے لیے بنیادی قیمت کا 2 گنا۔ پانچ منٹ کا cache ایک read کے بعد اپنی لاگت پوری کر لیتا ہے، جبکہ ایک گھنٹے کا cache دو reads کے بعد۔ یہی حساب اس بات کی مکمل وجہ ہے کہ ہر جگہ اسے فعال کرنے سے پہلے یہ معلوم کریں کہ prompt caching کب لاگت پوری کرتی ہے۔
Batch API دونوں جانب 50% رعایت دیتی ہے، اس لیے batched Fable 5 کام کی لاگت فی ایک ملین tokens $5 اور $25 ہے۔ Batch requests asynchronous ہوتی ہیں، اس لیے یہ صرف ایسے کام کے لیے مفید ہے جس کے جواب کی فوری ضرورت نہ ہو۔ دونوں رعایتیں جمع ہو جاتی ہیں، جس سے cached، batched job دونوں بنیادوں پر کم لاگت بنتی ہے۔
1M token context window، Claude 4.6 اور اس کے بعد کے models میں standard rates کے تحت شامل ہے۔ طویل context کے لیے کوئی اضافی surcharge نہیں ہے، اس لیے 900k tokens کی request پر فی token وہی rate لاگو ہوتا ہے جو 9k tokens کی request پر ہوتا ہے۔
جو multiplier bill میں اضافہ کرتا ہے وہ data residency ہے۔ inference_geo: "us" کو inference کو United States کے اندر رکھنے کے لیے set کرنے سے ہر token category پر 1.1 گنا multiplier لاگو ہوتا ہے، جس میں cache reads اور cache writes بھی شامل ہیں۔ جب تک کوئی contract اس کا تقاضا نہ کرے، default global routing برقرار رکھیں۔
اس model کے لیے billing کا ایک اصول مخصوص ہے۔ Fable 5 میں safety classifiers شامل ہیں جو کسی request کو مسترد کر سکتے ہیں۔ ایسی صورت میں Messages API error کے بجائے stop_reason: "refusal" کو کامیاب HTTP 200 response کے طور پر واپس کرتی ہے، اور اگر کوئی output generate ہونے سے پہلے request مسترد ہو جائے تو اس کی billing نہیں ہوتی۔ اگر آپ اسی prompt کو کسی دوسرے Claude model پر دوبارہ بھیجتے ہیں تو fallback credit اس تبدیلی کی prompt cache cost واپس کر دیتا ہے، اس لیے ایک ہی cache کو دو بار warm کرنے کی لاگت ادا نہیں کرنی پڑتی۔
کون سے plans میں Claude Fable 5 شامل ہے؟
3 August 2026 تک، Anthropic کے Claude Fable صفحے کے مطابق یہ model Pro، Max، Team اور Enterprise users کے لیے دستیاب ہے۔ Free plan کا نام نہیں دیا گیا۔ Pro اس فہرست میں سب سے سستا seat ہے، اس لیے Pro کی قیمت اور اس کے usage limits کی حد Fable کے لیے کسی بھی subscription route کی کم از کم لاگت متعین کرتی ہے۔ اگر Fable access upgrade کرنے کی بنیادی وجہ ہے تو پہلے اپنے استعمال کے لیے Pro seat کی ادائیگی مناسب ہے یا نہیں کا جائزہ لیں، کیونکہ محدود Fable allowance اکیلے subscription کی مضبوط وجہ نہیں بنتی۔ Developers کے لیے یہ Claude API اور اوپر درج cloud marketplaces پر عمومی طور پر دستیاب ہے۔ اس route پر free tier نہیں ہے، اس لیے signup پر Anthropic کی طرف سے دیا جانے والا چھوٹا credit ہی meter شروع ہونے سے پہلے آپ کو ملتا ہے۔
کسی plan پر دستیاب ہونا، لامحدود طور پر شامل ہونے کے برابر نہیں ہے۔ اسی طرح subscription کی پیمائش API کی طرح نہیں ہوتی، کیونکہ Pro seat کے لیے token quota شائع ہی نہیں کیا گیا اور اس کے بجائے استعمال کو rolling window کے دوران messages میں شمار کیا جاتا ہے۔ اس لیے کسی plan میں شامل چیز کو اوپر دیے گئے فی million اعداد میں براہِ راست تبدیل نہیں کیا جا سکتا۔
Anthropic کے pricing page پر موجود plan comparison table میں بعض seats کے لیے Fable تک رسائی weekly usage limits کے ایک حصے سے مشروط ہے، جبکہ دیگر seats کے لیے usage credits درکار ہیں۔ یہ انتظام July 2026 کے دوران ایک سے زیادہ مرتبہ تبدیل ہوا۔ Fable 5 کو دوبارہ deploy کرنے سے متعلق Anthropic کے اپنے بیان کے مطابق، Pro، Max، Team اور منتخب Enterprise plans میں 7 July 2026 تک weekly usage limits کے زیادہ سے زیادہ 50% تک model دستیاب تھا؛ اس تاریخ کے بعد usage credits لاگو ہوئے۔ July کے باقی عرصے کی رپورٹس میں مزید توسیعات اور مختلف seat types کے درمیان تقسیم کا ذکر کیا گیا۔
اس لیے یہ صفحہ فی plan limit درج نہیں کرے گا۔ اس مہینے کے دوران شائع ہونے والا کوئی بھی figure دو ہفتوں تک برقرار نہیں رہا، اور یہاں پرانا number درج کرنا کسی number کے بغیر رہنے سے زیادہ نقصان دہ ہوگا۔ جس دن فیصلہ کریں، plan comparison table میں Fable کے نام والی row کھولیں، اور news article میں موجود کسی بھی number کو پرانا سمجھیں۔ اگر آپ Fable access کے لیے seat لیتے ہیں اور allowance table کی توقع سے کم نکلتی ہے تو اگلی renewal سے پہلے plan کو نچلے درجے پر واپس کرنا اس month کو برقرار رکھتا ہے جس کی ادائیگی آپ پہلے ہی کر چکے ہیں۔
جو چیز مستحکم ہے وہ API rate ہے۔ ہر route پر included allowance ختم ہونے کے بعد Fable 5 کا مزید usage اوپر chart میں دی گئی prices کے مطابق bill ہوتا ہے۔ Enterprise اس structure کو واضح کرتا ہے، کیونکہ Enterprise seat fee access خریدتی ہے، جبکہ tokens پر API rates کے مطابق الگ meter چلتا رہتا ہے۔ اس لیے دونوں صورتوں میں planning کے لیے price list ہی بنیادی number ہے۔ یہی نتیجہ آپ کسی دوسرے Claude model کے لیے API billing کا subscription سے موازنہ کرتے وقت بھی اخذ کرتے ہیں۔ اگر آپ نے ابھی tier منتخب نہیں کیا تو کون سا Claude plan آپ کے usage سے مطابقت رکھتا ہے سے آغاز کریں۔ اگر یہ seat صرف Fable تک رسائی کا ذریعہ نہیں بلکہ آپ کا روزمرہ assistant بھی ہوگا تو commit کرنے سے پہلے Claude plans کی قیمتوں کا ChatGPT کے plans سے موازنہ کرنا مفید ہے۔
قیمت کے تناسب سے ظاہر ہونے والی رقم سے bill زیادہ کیوں آتا ہے
دو documented mechanisms کی وجہ سے Fable 5 کی لاگت سادہ price comparison سے ظاہر ہونے والی لاگت سے زیادہ ہوتی ہے۔
پہلا mechanism tokenizer ہے۔ Fable 5 وہ tokenizer استعمال کرتا ہے جو Claude Opus 4.7 کے ساتھ متعارف کرایا گیا تھا۔ Opus 4.7 سے پہلے جاری کیے گئے models کے مقابلے میں ایک ہی متن سے تقریباً 30% زیادہ tokens بنتے ہیں، اور درست اضافہ content پر منحصر ہوتا ہے۔ Haiku 4.5 اس tokenizer سے پہلے کا model ہے، اس لیے price list میں دس گنا فرق دونوں models کو ایک ہی متن دینے پر تقریباً تیرہ گنا ہو جاتا ہے۔ Sonnet 5 نیا tokenizer استعمال کرتا ہے، اس لیے Fable اور Sonnet کے درمیان per-token comparison درست ہے۔ Fable اور Haiku کے درمیان یہ comparison درست نہیں۔
دوسرا mechanism thinking ہے۔ Fable 5 میں adaptive thinking ہمیشہ فعال رہتی ہے، اور thinking: {"type": "disabled"} supported نہیں ہے۔ Thinking tokens کو output tokens کے طور پر، مکمل output rate پر bill کیا جاتا ہے۔ اس model میں raw chain of thought کبھی واپس نہیں کی جاتی، اور thinking.display کی default value "omitted" ہے۔ اس کا مطلب ہے کہ مختصر visible answer کے ساتھ billed output count بہت زیادہ ہو سکتا ہے۔ Anthropic کی documentation اس بات کو واضح طور پر بیان کرتی ہے: billed output token count، response میں دکھائی دینے والے token count کے برابر نہیں ہوتا۔
اندازہ لگانے کے بجائے breakdown دیکھیں۔ usage.output_tokens_details.thinking_tokens field بتاتی ہے کہ کتنے billed output tokens reasoning پر خرچ ہوئے:
{
"usage": {
"input_tokens": 25,
"output_tokens": 348,
"output_tokens_details": {
"thinking_tokens": 312
}
}
}Anthropic کی thinking documentation سے لی گئی اس مثال میں 348 billed output tokens میں سے 312 reasoning کے لیے تھے، جنہیں کسی نے نہیں دیکھا۔ جب آپ stream کرتے ہیں تو یہ breakdown صرف آخری message_delta event پر آتا ہے۔ اس لیے جو client آخری text chunk کے بعد reading روک دیتا ہے، وہ اسے کبھی record نہیں کرے گا۔
اس کا control effort ہے، جسے output_config.effort پر set کیا جاتا ہے۔ اس کی levels low، medium، high (default)، xhigh اور max ہیں۔
{
"model": "claude-fable-5",
"max_tokens": 32000,
"output_config": { "effort": "medium" },
"messages": [{ "role": "user", "content": "..." }]
}Anthropic کی اس model کے لیے guidance یہ ہے کہ high سے شروع کریں، صرف انتہائی capability-sensitive کام کے لیے xhigh تک جائیں، اور routine کام کے لیے medium یا low پر آ جائیں۔ وجہ یہ ہے کہ Fable 5 میں کم effort اکثر پہلے کے models میں xhigh سے بہتر نتیجہ دیتا ہے۔ اس کے ساتھ دو traps بھی ہیں۔ Requests کے درمیان effort تبدیل کرنے سے prompt cache invalid ہو جاتا ہے، کیونکہ resolved effort value prompt میں شامل کی جاتی ہے۔ اس لیے ہر workload کے لیے ایک level منتخب کریں اور اسے مستقل رکھیں۔ مزید یہ کہ max_tokens مجموعی output کی hard cap ہے، جس میں thinking اور response text دونوں شامل ہیں۔ اس لیے ایسی cap جو thinking کے بغیر answer کے لیے کافی ہو، output کو truncate کر دے گی۔ stop_reason: "max_tokens" نظر آنے کا مطلب ہے کہ آپ cap بڑھائیں یا effort کم کریں۔
مکمل کیے گئے کام کی لاگت، ٹوکن کی لاگت نہیں
The data behind this chart
[
{
"label": "Short answer (5k in, 1k out)",
"fable_5": "0.10",
"opus_5": "0.05",
"sonnet_5": "0.02",
"haiku_4_5": "0.01"
},
{
"label": "Coding session (300k in, 40k out)",
"fable_5": "5.00",
"opus_5": "2.50",
"sonnet_5": "1.00",
"haiku_4_5": "0.50"
},
{
"label": "Long agent run (2M in, 400k out)",
"fable_5": "40.00",
"opus_5": "20.00",
"sonnet_5": "8.00",
"haiku_4_5": "4.00"
}
]یہ 3 قطاریں حسابی مثالیں ہیں، benchmark نہیں۔ شرحیں شائع شدہ ہیں۔ ٹوکن کی مقداریں مفروضے ہیں؛ انہیں اپنے استعمال کے ڈیٹا سے حاصل کردہ اعداد سے تبدیل کریں۔ درمیانی قطار جیسا coding session Fable 5 پر $5.00 اور Sonnet 5 پر $1.00 کا خرچ رکھتا ہے۔ طویل run کی لاگت Fable 5 پر $40.00 اور Sonnet 5 پر $8.00 ہے۔ آخری قطار میں Haiku column صرف حسابی ہے: Haiku 4.5 میں 200k ٹوکن کی context window ہے، اس لیے وہ اس کام کو بالکل hold نہیں کر سکتا۔
فی ٹوکن لاگت فیصلہ کرنے کے لیے غلط unit ہے۔ مکمل کیے گئے کام کی لاگت، فی کوشش کی لاگت کو کوششوں کی تعداد سے ضرب دینے کے برابر ہے۔ آج کی شرحوں پر Fable 5 کی ایک کوشش کی لاگت Sonnet 5 کی پانچ کوششوں کے برابر ہے، اس لیے صرف retry count تقریباً کبھی بھی upgrade کا جواز نہیں بنتا۔ سستے راستے کے مقابلے میں tokens کے لحاظ سے نقصان میں جانے کے لیے Sonnet کو پانچ میں سے 4 سے زیادہ کوششوں میں fail ہونا پڑے گا۔
اس upgrade کا جواز وہ تمام عوامل بنتے ہیں جو token bill میں شامل نہیں ہوتے۔ chart میں دونوں طویل runs کے درمیان فرق، زیادہ تر markets میں engineer کے ایک گھنٹے کے وقت سے کم ہے۔ اگر مہنگا model review میں ایک گھنٹہ بچا دے، یا ایسی ایک خراب migration سے بچا لے جسے بعد میں واپس درست کرنا پڑے، تو وہ ایسی bill پر بھی اپنی لاگت پوری کر چکا ہے جس میں یہ بچت دکھائی نہیں دیتی۔ موازنہ accepted result کے لیے خرچ ہونے والی رقم کی بنیاد پر کریں، اور کل لاگت میں اپنا وقت بھی شامل کریں۔ یہ جاننا کہ 1 million ٹوکن حقیقت میں کیا خرید سکتے ہیں اس تخمینے کو کہیں کم مجرد بنا دیتا ہے۔
تین کام جہاں Claude Fable 5 اپنی قیمت ثابت کرتا ہے
طویل دورانیے کے agent runs، جہاں غلط موڑ مہنگا پڑتا ہے۔ Fable 5 ایسے کاموں کے لیے بنایا گیا ہے جن کی پیمائش گھنٹوں میں ہوتی ہے: اس میں 1M token context window، ہر request کے لیے زیادہ سے زیادہ 128k output tokens، اور xhigh effort level شامل ہے۔ یہ سطح ان کاموں کے لیے ہے جو تیس منٹ سے زیادہ چلتے ہیں اور جن کے token budgets millions میں ہوتے ہیں۔ اس run کا موازنہ اس cleanup کے ساتھ کریں جو agent کے step 40 پر غلط branch لینے کے بعد درکار ہوگا، اگر کسی کو اس کا پتا step 300 تک نہ چلے۔
کسی بڑے codebase میں ایک بار چلائی جانے والی migration یا audit۔ ایک بار ہونے والے کام میں لاگت کم کرنے کے لیے volume دستیاب نہیں ہوتا، اس لیے فی token اضافی قیمت ایک ہی invoice پر آتی ہے، اور پورا کام ممکن ہے کہ ایک ہی context window میں سما جائے۔ اگر یہ asynchronous طور پر چل سکتا ہو تو Batch API اسے output tokens کے ہر million کے لیے $25 تک نصف کر دیتا ہے۔
وہ task جس میں سستا model پہلے ہی دو بار ناکام ہو چکا ہو۔ دو ناکام کوششوں اور آپ کے debugging وقت کی لاگت اوپر کے chart میں دیے گئے volumes پر ایک Fable کوشش سے زیادہ ہوتی ہے۔ اس لیے escalation کم خرچ branch ہے، اور model ladder اسی مقصد کے لیے ہے۔ اگر آپ اب بھی عمومی طور پر tiers کے درمیان انتخاب کر رہے ہیں تو Claude model tiers کے capability comparison اس صفحے سے مختلف سوال کا جواب دیتا ہے۔
تین کام جن میں Sonnet 5 یا Haiku 4.5 ہی درست انتخاب ہیں
زیادہ حجم والی درجہ بندی اور extraction۔ ان کاموں کی جانچ throughput اور فی یونٹ لاگت کی بنیاد پر ہوتی ہے، جبکہ معیار کی حد اتنی کم ہے کہ سستا model بھی اسے حاصل کر لیتا ہے۔ جس کام کو Haiku 4.5 دس گنا کم قیمت پر درست طور پر مکمل کر لیتا ہے، اس کے لیے Fable 5 استعمال کرنے سے قابلِ پیمائش کوئی فائدہ نہیں ملتا۔
وہ interactive کام جن میں latency ہی اصل نتیجہ ہے۔ Anthropic کی model table میں Fable 5 کی comparative latency زیادہ بتائی گئی ہے، اور thinking کو بند نہیں کیا جا سکتا۔ chat box یا editor completion میں زیادہ قابل model کا تجربہ خراب محسوس ہوتا ہے، کیونکہ صارف معیار محسوس کرنے سے پہلے انتظار محسوس کرتا ہے۔
وہ کام جو January 2026 کے بعد کے events پر منحصر ہوں۔ Fable 5 کا reliable knowledge cutoff January 2026 ہے۔ Opus 5 کا cutoff May 2026 ہے۔ زیادہ مہنگا model کم تازہ معلومات رکھتا ہے، اس لیے recency سے متعلق سوالات میں search یا fetch tools فراہم نہ کیے جائیں تو آپ پرانی معلومات کے لیے دوگنی قیمت ادا کرتے ہیں۔
ایک پابندی ایسی ہے جس کا تعلق cost سے بالکل نہیں۔ Fable 5 میں 30 day data retention ہے اور یہ zero data retention کے تحت دستیاب نہیں، کیونکہ اسے Covered Model کے طور پر designated کیا گیا ہے۔ اگر آپ کے agreement میں zero retention لازمی ہے تو Fable 5 کسی بھی قیمت پر option نہیں ہے، اور کوئی discount اس حقیقت کو تبدیل نہیں کرتا۔
fable-method repositories کیا ظاہر کرتے ہیں، اور کیا ظاہر نہیں کرتے
ماہرین نے ایسے repositories شائع کیے ہیں جو Fable 5 کے طریقۂ کار کو مختصر شکل میں بیان کرتے ہیں، تاکہ کم لاگت والا model ان پر عمل کر سکے۔ fable-method repository میں ایک فکری مہارت، ایک orchestration loop، اور ایک adversarial verifier بیان کیا گیا ہے۔ یہ verifier agent کی اپنی رپورٹ پڑھنے کے بجائے ہر دعوے کردہ check کو دوبارہ چلاتا ہے۔ اس کے README میں یہ بات براہِ راست لکھی ہے: "یہ community distillation ہے، Anthropic artifact نہیں۔"
اسے بالکل اسی حیثیت سے دیکھیں۔ یہ اس بات کا ثبوت ہے کہ لوگ model کو کس طرح چلا رہے ہیں، نہ کہ اس بات کی documentation کہ model کیسے کام کرتا ہے۔ اس میں موجود کسی چیز کی Anthropic نے توثیق نہیں کی۔ مزید یہ کہ تقریباً یکساں کئی forks مختلف wording کے ساتھ موجود ہیں۔ یہ کسی spec کے بجائے زبانی طور پر منتقل ہونے والے طریقۂ کار سے متوقع ہے۔
لاگت سے متعلق فیصلے کے لیے اہم signal یہ ہے کہ لوگوں نے جن حصوں کو نقل کرنا مفید سمجھا، وہ procedural ہیں۔ task کی درجہ بندی کریں، وہ check متعین کریں جو ثابت کرے کہ task مکمل ہے، فیصلہ کرنے سے پہلے evidence جمع کریں، پھر summary پڑھنے کے بجائے observation سے verification کریں۔ اگر کم لاگت والے model کو واضح checklist اور verification step دیا جائے تو وہ فرق کا ایک حصہ کم کر سکتا ہے۔ اس لیے مہنگے model کو standard بنانے سے پہلے یہ experiment اپنے evaluation set پر چلائیں۔ نتیجہ آپ کے tasks پر منحصر ہے، اسی وجہ سے کسی دوسرے شخص کا number آپ کے لیے زیادہ قابلِ اعتماد نہیں۔
بجٹ مختص کرنے سے پہلے اپنے اعداد و شمار خود جانچیں
- ہر جواب میں
usageپڑھیں، اورoutput_tokens_details.thinking_tokensکو دکھائی دینے والے output سے الگ log کریں۔ وہ reasoning جو آپ کو نظر نہیں آتی، اکثر غیر متوقع لاگت کا سبب بنتی ہے۔ effortکو واضح طور پر set کریں، default قبول نہ کریں، اور prompt caching پر منحصر کسی بھی conversation کے اندر اسے مستقل رکھیں۔- پہلے اپنے مستحکم prefix کو cache breakpoint کے پیچھے رکھیں۔ base input price کے دسویں حصے پر cache read کی لاگت، اکثر model downgrade کے مقابلے میں زیادہ بچت فراہم کرتی ہے۔
- جس کام کے لیے فوری جواب درکار نہ ہو، اسے Batch API میں منتقل کریں۔
- متبادل کی لاگت دیانت داری سے معلوم کریں۔ اپنے workload پر Claude اور ChatGPT API pricing کا موازنہ طویل مدتی commitment سے پہلے ایک دوپہر صرف کرنے کے قابل ہے۔
اگر workload آپ کے اپنے server پر چلنے والا agent ہے تو سب سے اہم controls کا تعلق model choice سے باہر کے حصے سے ہوتا ہے۔ VPS پر agent کی لاگت قابو میں رکھنا ان loop limits اور spend caps کا احاطہ کرتا ہے جو بے قابو session کو روکتے ہیں، جبکہ Claude Code دراصل کہاں tokens خرچ کرتا ہے ان اعداد کی وضاحت کرتا ہے جو آپ اپنے usage dashboard میں دیکھیں گے۔
FAQ
Claude Fable 5 کی فی ملین tokens قیمت کتنی ہے؟
Claude API پر Claude Fable 5 کی قیمت فی ملین input tokens $10 اور فی ملین output tokens $50 ہے۔ یہ قیمتیں 3 August 2026 کو Anthropic کے pricing page پر دیکھی گئی تھیں۔ Cache read کی قیمت فی ملین tokens $1 ہے، جو بنیادی input rate کا ایک tenth ہے۔ Batch API دونوں جانب 50% رعایت دیتی ہے، جس کے بعد asynchronous کام کے لیے فی ملین tokens $5 اور $25 لاگو ہوتے ہیں۔ inference_geo parameter کے ذریعے inference کو United States کے اندر رکھنے پر ہر category میں 1.1 times multiplier شامل ہو جاتا ہے۔
کیا Claude Fable 5، Claude Pro subscription میں شامل ہے؟
Anthropic کے Claude Fable page پر یہ model Pro، Max، Team اور Enterprise users کے لیے دستیاب دکھایا گیا ہے، جبکہ free plan کا نام نہیں دیا گیا۔ شامل access unlimited نہیں ہے۔ کچھ seats میں Fable weekly usage limits کے حصے کے طور پر دستیاب ہوتا ہے، جبکہ کچھ users اسے usage credits کے ذریعے استعمال کرتے ہیں۔ یہ انتظام July 2026 کے دوران ایک سے زیادہ مرتبہ تبدیل ہوا۔ فیصلہ کرتے وقت Anthropic کے pricing page پر plan comparison table میں Fable کے نام والی row اسی دن پڑھیں، اور کسی article میں دی گئی figure پر بھروسا نہ کریں۔ شامل allowance ختم ہونے کے بعد اضافی usage API rate کے مطابق bill ہوتی ہے۔
Claude Fable 5 کا bill، نظر آنے والے output سے زیادہ کیوں ہے؟
Claude Fable 5 میں adaptive thinking ہمیشہ enabled ہوتی ہے، thinking tokens کو output tokens کے طور پر bill کیا جاتا ہے، اور raw chain of thought واپس نہیں کی جاتی۔ thinking.display کی default قدر omitted ہونے پر آپ کو thinking field خالی نظر آتا ہے، لیکن اس کے پس پردہ ہر reasoning token کی ادائیگی ہوتی ہے۔ تقسیم دیکھنے کے لیے response میں usage.output_tokens_details.thinking_tokens پڑھیں۔ Streaming کے دوران یہ صرف آخری message_delta event میں موصول ہوتا ہے۔ اگر reasoning اور answer کا تناسب task کی ضرورت سے زیادہ ہو تو effort level کم کریں۔
کیا مجھے Claude Fable 5 استعمال کرنا چاہیے یا Claude Opus 5؟
Claude Opus 5 فی token نصف قیمت رکھتا ہے اور اس کا reliable knowledge cutoff زیادہ نیا ہے: Fable 5 کے لیے January 2026 کے مقابلے میں Opus 5 کے لیے May 2026۔ Opus 5 سے شروع کریں اور صرف اس وقت Fable 5 پر جائیں جب task وہاں ناکام ہو، یا غلط answer کی لاگت price difference سے زیادہ ہو۔ Fable 5 طویل مدتی agent work کے لیے موزوں ہے، جہاں ایک غلط branch کی اصلاح میں گھنٹے لگ سکتے ہیں۔ یہ ان one-off jobs کے لیے بھی مناسب ہے جن کا اضافی خرچ ہر request پر مستقل طور پر آنے کے بجائے ایک ہی invoice میں شامل ہو جاتا ہے۔