SSD Nodes Learn 🎉 VPS $5.50/ماہ سے
تعلیمی Matt Connorتحریر: Matt Connor · اپ ڈیٹ شدہ 2026-08-13

Claude Fable 5 کی قیمت اور اسے کب استعمال کریں

Claude Fable 5 کی قیمت $10 فی million input tokens اور $50 فی million output ہے۔ جانیں یہ rates آپ کے اصل API کاموں کے bill پر کیسے اثر ڈالتی ہیں۔

Claude Fable 5 کی قیمت کیا ہے؟

Claude API پر Claude Fable 5 کی قیمت input tokens کے فی million $10 اور output tokens کے فی million $50 ہے۔ یہ Anthropic کی شائع کردہ list rates ہیں، جو 3 August 2026 کو pricing page سے حاصل کی گئی تھیں۔ API model ID claude-fable-5 ہے۔ یہ 9 June 2026 کو Claude API، Amazon Bedrock، Claude Platform on AWS، Google Cloud اور Microsoft Foundry پر عمومی طور پر دستیاب ہوا۔

ChartPublished Claude API list prices, US dollars per million tokens, checked 3 August 2026
The data behind this chart
[
  {
    "label": "Claude Fable 5",
    "input": "10",
    "output": "50",
    "cache_read": "1",
    "batch_input": "5",
    "batch_output": "25"
  },
  {
    "label": "Claude Opus 5",
    "input": "5",
    "output": "25",
    "cache_read": "0.50",
    "batch_input": "2.50",
    "batch_output": "12.50"
  },
  {
    "label": "Claude Sonnet 5 (intro rate)",
    "input": "2",
    "output": "10",
    "cache_read": "0.20",
    "batch_input": "1",
    "batch_output": "5"
  },
  {
    "label": "Claude Sonnet 5 (from 1 Sep)",
    "input": "3",
    "output": "15",
    "cache_read": "0.30",
    "batch_input": "1.50",
    "batch_output": "7.50"
  },
  {
    "label": "Claude Haiku 4.5",
    "input": "1",
    "output": "5",
    "cache_read": "0.10",
    "batch_input": "0.50",
    "batch_output": "2.50"
  }
]

اسے ایک درجہ بندی کے طور پر سمجھیں۔ Fable 5 کی فہرست شدہ قیمت Claude Opus 5 سے دو گنا، موجودہ Claude Sonnet 5 rate سے پانچ گنا، اور Claude Haiku 4.5 سے دس گنا ہے۔ bill کے دونوں حصوں میں ratio یکساں ہے، کیونکہ اس chart میں ہر model اپنے input rate کے ٹھیک پانچ گنا پر output کی قیمت مقرر کرتا ہے۔ اس لیے اگر آپ کو کسی job کے input اور output tokens کی تقسیم معلوم ہو تو multiplication کے ذریعے ایک price کو کسی بھی دوسری price میں تبدیل کیا جا سکتا ہے۔

ایک تاریخ حساب بدل دیتی ہے۔ Sonnet 5 کے لیے 31 August 2026 تک introductory pricing نافذ ہے: فی million tokens $2 input اور $10 output۔ 1 September 2026 سے اس کی فہرست شدہ قیمت $3 input اور $15 output ہوگی۔ Fable 5 کی اپنی price تبدیل نہیں ہوگی، اس لیے اس دن دونوں کے درمیان فرق پانچ گنا سے کم ہو کر تین گنا سے کچھ زیادہ رہ جائے گا۔ اگر آپ autumn کے لیے budget تیار کر رہے ہیں تو Sonnet کے بعد والے اعداد استعمال کریں۔

وہ رعایتیں، اور ایک ایسا multiplier جو لاگت بڑھاتا ہے

Prompt caching سب سے بڑا اثر ڈالنے والا عامل ہے۔ Cache read کی لاگت base input price کے دسویں حصے کے برابر ہے۔ Fable 5 پر یہ فی million tokens $1 ہے۔ Cache میں لکھنے کی لاگت عام input token سے زیادہ ہے: پانچ منٹ کے cache کے لیے base کا 1.25 گنا، اور ایک گھنٹے کے cache کے لیے base کا 2 گنا۔ پانچ منٹ کا cache ایک read کے بعد اپنی لاگت پوری کر دیتا ہے، جبکہ ایک گھنٹے کا cache دو reads کے بعد۔ یہی حساب اس بات کی پوری وجہ ہے کہ ہر جگہ اسے فعال کرنے سے پہلے یہ معلوم کرنا کہ prompt caching کہاں break-even ہوتی ہے ضروری ہے۔

Batch API دونوں جانب 50% رعایت دیتا ہے۔ اس لیے batched Fable 5 کام کی لاگت فی million tokens $5 اور $25 ہے۔ Batch requests asynchronous ہوتی ہیں، اس لیے یہ صرف ایسے کام کے لیے مفید ہے جس کا جواب فوراً درکار نہ ہو۔ دونوں رعایتیں جمع ہو جاتی ہیں، جس سے cached اور batched job دونوں پہلوؤں سے کم لاگت بنتی ہے۔

1M token context window، Claude 4.6 اور اس کے بعد کے models پر standard rates میں شامل ہے۔ Long context کے لیے کوئی اضافی surcharge نہیں ہے۔ اس لیے 900k tokens کی request پر فی token وہی rate لاگو ہوتا ہے جو 9k tokens کی request پر ہوتا ہے۔

وہ multiplier جو bill بڑھاتا ہے، data residency ہے۔ inference کو United States کے اندر رکھنے کے لیے inference_geo: "us" مقرر کرنے سے ہر token category پر 1.1 گنا multiplier لاگو ہوتا ہے، جس میں cache reads اور cache writes بھی شامل ہیں۔ جب تک کوئی contract اس کا تقاضا نہ کرے، default global routing برقرار رکھیں۔

اس model کے لیے billing کا ایک اصول مخصوص ہے۔ Fable 5 ایسے safety classifiers فراہم کرتا ہے جو کسی request کو مسترد کر سکتے ہیں۔ ایسا ہونے پر Messages API error کے بجائے stop_reason: "refusal" کو کامیاب HTTP 200 response کے طور پر واپس کرتا ہے، اور اگر کوئی output generate ہونے سے پہلے request مسترد کر دی جائے تو اس کی billing نہیں ہوتی۔ اگر آپ اسی prompt کو کسی دوسرے Claude model پر retry کریں تو fallback credit اس switch کی prompt cache cost واپس کر دیتا ہے۔ اس طرح اسی cache کو دوبارہ warm کرنے کی ادائیگی نہیں کرنی پڑتی۔

کون سے plans میں Claude Fable 5 شامل ہے؟

3 August 2026 تک Anthropic کے Claude Fable صفحے کے مطابق یہ model Pro، Max، Team اور Enterprise users کے لیے دستیاب ہے۔ free plan کا نام نہیں دیا گیا۔ Pro اس فہرست میں سب سے سستا seat ہے، اس لیے Pro کی قیمت اور اس کے usage limits کہاں ختم ہوتے ہیں کسی بھی subscription route کے لیے Fable کی کم از کم لاگت متعین کرتا ہے۔ Developers کے لیے یہ Claude API اور اوپر درج cloud marketplaces کے ذریعے عام طور پر دستیاب ہے۔ اس route پر free tier نہیں ہے، اس لیے Anthropic signup کے وقت دیا جانے والا چھوٹا credit ہی meter شروع ہونے سے پہلے دستیاب ہوتا ہے۔

کسی plan پر دستیاب ہونا، بغیر کسی limit کے شامل ہونے کے برابر نہیں ہے۔ Anthropic کے pricing page پر موجود plan comparison table بعض seats کے لیے Fable کو weekly usage limits کے ایک حصے کے ساتھ، اور دوسری seats کے لیے usage credits کے ساتھ محدود کرتی ہے۔ یہ arrangement July 2026 کے دوران ایک سے زیادہ مرتبہ بدلا۔ Fable 5 کو دوبارہ deploy کرنے سے متعلق Anthropic کے اپنے بیان میں Pro، Max، Team اور منتخب Enterprise plans کے لیے 7 July 2026 تک weekly usage limits کے 50% تک model شامل تھا، جبکہ اس تاریخ کے بعد usage credits لاگو ہوئے۔ July کے باقی حصے کی reporting میں مزید توسیع اور seat types کے درمیان تقسیم بیان کی گئی۔

اس لیے یہ صفحہ ہر plan کے لیے الگ limit درج نہیں کرے گا۔ اس مہینے شائع ہونے والا کوئی بھی figure دو ہفتے تک برقرار نہیں رہا، اور یہاں پرانا number درج کرنا کسی number کے بغیر رہنے سے زیادہ گمراہ کن ہوگا۔ جس دن فیصلہ کریں، plan comparison table میں Fable کے نام والی row کھولیں، اور کسی news article میں موجود number کو پرانا سمجھیں۔ اگر آپ Fable access کے لیے seat لیتے ہیں اور allowance table کی توقع سے کم نکلتا ہے تو اگلی renewal سے پہلے plan پر واپس آنا پہلے سے ادا کیے گئے مہینے کو برقرار رکھتا ہے۔

جو چیز مستحکم ہے وہ API rate ہے۔ ہر route پر، included allowance استعمال ہونے کے بعد Fable 5 کا مزید استعمال اوپر کے chart میں دی گئی prices کے مطابق bill ہوگا۔ Enterprise اس structure کو واضح کرتا ہے، کیونکہ Enterprise seat fee access خریدتی ہے، جبکہ tokens اس کے علاوہ API rates کے مطابق meter ہوتے رہتے ہیں۔ اس لیے دونوں صورتوں میں planning کے لیے price list ہی بنیادی number ہے۔ یہی نتیجہ کسی دوسرے Claude model کے لیے API billing کا subscription سے موازنہ کرتے وقت بھی سامنے آتا ہے۔ اگر آپ نے ابھی tier منتخب نہیں کیا تو دیکھیں کہ کون سا Claude plan آپ کے usage سے مطابقت رکھتا ہے۔ اگر وہ seat Fable تک رسائی کے بجائے آپ کا روزمرہ assistant بھی ہوگا تو commit کرنے سے پہلے یہ جانچنا مفید ہے کہ Claude plans کی قیمتیں ChatGPT کے مقابلے میں کیا ہیں۔

آپ کا بل price ratio سے ظاہر ہونے والی رقم سے زیادہ کیوں بنتا ہے

دو documented mechanisms کی وجہ سے Fable 5 کی لاگت سادہ price comparison سے ظاہر ہونے والی لاگت سے زیادہ بنتی ہے۔

پہلی وجہ tokenizer ہے۔ Fable 5 وہ tokenizer استعمال کرتا ہے جو Claude Opus 4.7 کے ساتھ متعارف کرایا گیا تھا۔ Opus 4.7 سے پہلے جاری کیے گئے models کے مقابلے میں یہی text تقریباً 30% زیادہ tokens پیدا کرتا ہے، اور درست اضافہ content پر منحصر ہوتا ہے۔ Haiku 4.5 اس tokenizer سے پہلے کا model ہے، اس لیے price list میں دس گنا فرق، دونوں models کو text کا ایک ہی block دینے پر، تقریباً تیرہ گنا ہو جاتا ہے۔ Sonnet 5 نیا tokenizer استعمال کرتا ہے، اس لیے Fable اور Sonnet کے درمیان per token comparison منصفانہ ہے۔ Fable اور Haiku کا comparison منصفانہ نہیں ہے۔

دوسری وجہ thinking ہے۔ Fable 5 میں adaptive thinking ہمیشہ فعال رہتی ہے، اور thinking: {"type": "disabled"} supported نہیں ہے۔ Thinking tokens کو output tokens کے طور پر، مکمل output rate پر، bill کیا جاتا ہے۔ اس model پر raw chain of thought کبھی واپس نہیں کی جاتی، اور thinking.display کی default value "omitted" ہے۔ اس کا مطلب ہے کہ مختصر visible answer کے ساتھ billed output count بہت زیادہ ہو سکتا ہے۔ Anthropic کی documentation میں یہ بات واضح ہے: billed output token count response میں visible token count کے برابر نہیں ہوتا۔

اندازہ لگانے کے بجائے breakdown دیکھیں۔ usage.output_tokens_details.thinking_tokens field بتاتی ہے کہ کتنے billed output tokens reasoning پر خرچ ہوئے:

{
  "usage": {
    "input_tokens": 25,
    "output_tokens": 348,
    "output_tokens_details": {
      "thinking_tokens": 312
    }
  }
}

یہ مثال Anthropic کی thinking documentation سے لی گئی ہے۔ اس میں 348 billed output tokens میں سے 312 reasoning کے لیے تھے، جسے کسی نے نہیں دیکھا۔ جب آپ stream کرتے ہیں تو یہ breakdown صرف آخری message_delta event پر موصول ہوتا ہے۔ اس لیے جو client آخری text chunk پر reading روک دیتا ہے، وہ اسے کبھی record نہیں کرے گا۔

اس کا control effort ہے، جسے output_config.effort پر set کیا جاتا ہے۔ اس کی levels low، medium، high (default)، xhigh اور max ہیں۔

{
  "model": "claude-fable-5",
  "max_tokens": 32000,
  "output_config": { "effort": "medium" },
  "messages": [{ "role": "user", "content": "..." }]
}

Anthropic کی اس model کے لیے guidance یہ ہے کہ high سے شروع کریں، صرف انتہائی capability-sensitive کام کے لیے xhigh تک جائیں، اور routine کام کے لیے medium یا low پر آ جائیں۔ وجہ یہ ہے کہ Fable 5 میں کم effort اکثر پہلے کے models پر xhigh سے بہتر نتیجہ دیتا ہے۔ اس کے ساتھ دو اہم traps ہیں۔ Requests کے درمیان effort تبدیل کرنے سے prompt cache invalid ہو جاتا ہے، کیونکہ resolved effort value prompt میں شامل کی جاتی ہے۔ اس لیے ہر workload کے لیے ایک level منتخب کریں اور اسے مستقل رکھیں۔ دوسری بات یہ ہے کہ max_tokens total output کی hard cap ہے، جس میں thinking اور response text دونوں شامل ہیں۔ اس لیے صرف answer کے لیے مقرر کیا گیا cap thinking شامل ہونے پر output کو truncate کر دے گا۔ stop_reason: "max_tokens" نظر آنے کا مطلب ہے کہ آپ cap بڑھائیں یا effort کم کریں۔

مکمل شدہ task کی لاگت، token کی نہیں

ChartCost of one job in US dollars, worked from published rates and assumed token volumes
The data behind this chart
[
  {
    "label": "Short answer (5k in, 1k out)",
    "fable_5": "0.10",
    "opus_5": "0.05",
    "sonnet_5": "0.02",
    "haiku_4_5": "0.01"
  },
  {
    "label": "Coding session (300k in, 40k out)",
    "fable_5": "5.00",
    "opus_5": "2.50",
    "sonnet_5": "1.00",
    "haiku_4_5": "0.50"
  },
  {
    "label": "Long agent run (2M in, 400k out)",
    "fable_5": "40.00",
    "opus_5": "20.00",
    "sonnet_5": "8.00",
    "haiku_4_5": "4.00"
  }
]

یہ 3 قطاریں arithmetic ہیں، benchmark نہیں۔ rates شائع شدہ ہیں۔ token volumes مفروضے ہیں؛ انہیں اپنی usage data کے اعداد سے تبدیل کریں۔ درمیانی قطار جیسا coding session، Fable 5 پر $5.00 اور Sonnet 5 پر $1.00 کا ہے۔ طویل run کی لاگت $40.00 کے مقابلے میں $8.00 ہے۔ آخری قطار میں Haiku column صرف arithmetic دکھاتا ہے: Haiku 4.5 کا context window 200k tokens کا ہے، اس لیے وہ job کو بالکل hold نہیں کر سکتا۔

فی token لاگت کسی فیصلے کے لیے غلط unit ہے۔ مکمل شدہ task کی لاگت، فی attempt لاگت کو attempts کی تعداد سے ضرب دینے کے برابر ہے۔ آج کے rates پر Fable 5 کی ایک attempt، Sonnet 5 کی پانچ attempts جتنی مہنگی ہے، اس لیے صرف retry count upgrade کا جواز تقریباً کبھی نہیں بنتا۔ tokens کے لحاظ سے سستا راستہ تبھی مہنگا ثابت ہوگا جب Sonnet پانچ میں سے چار سے زیادہ بار fail ہو۔

اس upgrade کا جواز وہ تمام عوامل فراہم کرتے ہیں جو token bill میں شامل نہیں ہوتے۔ chart میں دونوں طویل runs کے درمیان فرق، زیادہ تر markets میں engineer کے ایک گھنٹے کے وقت سے کم ہے۔ اگر مہنگا model review میں ایک گھنٹہ بچا دے، یا ایسی ایک خراب migration سے بچا لے جسے بعد میں واپس درست کرنا پڑے، تو اس نے خود کو پہلے ہی ادا کر دیا ہے؛ bill میں یہ بچت نظر نہیں آتی۔ موازنہ accepted result کی فی لاگت کے لحاظ سے کریں، اور total میں اپنا وقت بھی شامل کریں۔ یہ جاننا کہ ایک million tokens حقیقت میں کیا خریدتے ہیں اس اندازے کو کہیں کم مجرد بنا دیتا ہے۔

تین کام جن کے لیے Claude Fable 5 کی قیمت مناسب ہے

ایسے طویل مدتی agent runs جن میں غلط موڑ مہنگا پڑتا ہے۔ Fable 5 کو گھنٹوں میں ناپے جانے والے کام کے لیے بنایا گیا ہے: اس میں 1M token context window، فی request زیادہ سے زیادہ 128k output tokens، اور xhigh effort level شامل ہے، جو تیس منٹ سے زیادہ چلنے والے اور millions میں token budgets رکھنے والے کاموں کے لیے موزوں ہے۔ اس run کا موازنہ اس cleanup سے کریں جو اس وقت درکار ہوگا جب agent step 40 پر غلط branch لے، اور کسی کو اس کا علم step 300 تک نہ ہو۔

بڑی codebase پر ایک بار چلائی جانے والی migration یا audit۔ ایک بار ہونے والے کام میں volume کے ذریعے لاگت تقسیم نہیں کی جا سکتی، اس لیے فی token اضافی قیمت ایک ہی invoice پر آتی ہے، اور پورا کام ممکن ہے کہ ایک ہی context window میں سما جائے۔ اگر یہ asynchronous طور پر چل سکتا ہو تو Batch API اس کی لاگت نصف کر کے output tokens کے فی million $25 کر دیتی ہے۔

وہ کام جس میں سستا model پہلے ہی دو بار ناکام ہو چکا ہو۔ دو ناکام کوششوں اور آپ کے debugging وقت کی لاگت، اوپر کے chart میں دیے گئے volumes پر، ایک Fable کوشش سے زیادہ ہو سکتی ہے۔ Escalating زیادہ سستا راستہ ہے، اور model ladder اسی مقصد کے لیے ہوتا ہے۔ اگر آپ اب بھی عمومی طور پر tiers کے درمیان انتخاب کر رہے ہیں تو Claude model tiers کے درمیان capability comparison اس صفحے سے مختلف سوال کا جواب دیتا ہے۔

تین کام جہاں Sonnet 5 یا Haiku 4.5 ہی درست انتخاب ہیں

زیادہ حجم والی درجہ بندی اور extraction۔ ان کاموں کی جانچ throughput اور فی یونٹ لاگت کی بنیاد پر ہوتی ہے، اور معیار کی حد اتنی کم ہوتی ہے کہ سستا model بھی اسے حاصل کر لیتا ہے۔ جس کام کو Haiku 4.5 درست طور پر مکمل کر لیتا ہے، اس کے لیے دس گنا قیمت ادا کرنے سے Fable 5 کوئی قابلِ پیمائش فائدہ نہیں دیتا۔

ایسا interactive کام جہاں latency ہی بنیادی معیار ہو۔ Anthropic کی model table میں Fable 5 کی تقابلی latency زیادہ یعنی slower درج ہے، اور thinking کو بند نہیں کیا جا سکتا۔ زیادہ قابل model کے ساتھ chat box یا editor completion کا تجربہ خراب محسوس ہوتا ہے، کیونکہ صارفین معیار محسوس کرنے سے پہلے انتظار محسوس کرتے ہیں۔

ایسا کوئی بھی کام جو January 2026 کے بعد کے واقعات پر منحصر ہو۔ Fable 5 کا قابلِ اعتماد knowledge cutoff January 2026 ہے۔ Opus 5 کا cutoff May 2026 ہے۔ زیادہ مہنگا model کم تازہ معلومات رکھتا ہے، اس لیے تازہ ترین معلومات سے متعلق سوالات میں search یا fetch tools فراہم نہ کیے جائیں تو آپ پرانی معلومات کے لیے دوگنی قیمت ادا کرتے ہیں۔

ایک پابندی لاگت سے بالکل الگ ہے۔ Fable 5 میں 30 day data retention ہے اور یہ zero data retention کے تحت دستیاب نہیں، کیونکہ اسے Covered Model نامزد کیا گیا ہے۔ اگر آپ کے معاہدے میں zero retention لازم ہے تو Fable 5 کسی بھی قیمت پر اختیار نہیں، اور کوئی discount اس حقیقت کو تبدیل نہیں کرتا۔

فابل-میتھڈ repositories کیا دکھاتی ہیں، اور کیا نہیں دکھاتیں

ماہرین نے ایسی repositories شائع کی ہیں جو یہ واضح کرتی ہیں کہ Fable 5 کے طریقۂ کار کو ایک کم لاگت والا model کس طرح follow کر سکتا ہے۔ fable-method repo میں ایک thinking skill، ایک orchestration loop، اور ایک adversarial verifier بیان کیے گئے ہیں۔ یہ verifier agent کی اپنی report پڑھنے کے بجائے ہر دعوے کردہ check کو دوبارہ چلاتا ہے۔ اس کے README میں یہ بات براہِ راست لکھی ہے: "This is a community distillation, not an Anthropic artifact."

اسے بالکل اسی حیثیت سے دیکھیں۔ یہ اس بات کا evidence ہے کہ لوگ model کو کس طرح چلا رہے ہیں، لیکن یہ اس بات کی documentation نہیں ہے کہ model کیسے کام کرتا ہے۔ اس میں موجود کسی چیز کی Anthropic نے توثیق نہیں کی۔ اس کے علاوہ، مختلف wording کے ساتھ کئی تقریباً یکساں forks بھی موجود ہیں۔ یہ کسی spec کے بجائے folklore سے زیادہ متوقع ہے۔

Cost decision کے لیے قابلِ استعمال signal یہ ہے کہ لوگوں نے جن حصوں کو نقل کرنے کے قابل سمجھا، وہ procedural ہیں۔ Task کو classify کریں، وہ check بیان کریں جو ثابت کرے کہ task مکمل ہے، فیصلہ کرنے سے پہلے evidence جمع کریں، پھر summary پڑھنے کے بجائے observation کے ذریعے verify کریں۔ جب کم لاگت والے model کو واضح checklist اور verification step دیا جاتا ہے تو یہ فرق جزوی طور پر کم ہو جاتا ہے۔ اس لیے مہنگے model کو standardize کرنے سے پہلے یہ experiment اپنے evaluation set پر چلائیں۔ نتیجہ آپ کے tasks پر منحصر ہوتا ہے، اسی لیے کسی اور کے number کی آپ کے لیے بہت کم اہمیت ہے۔

کمٹ کرنے سے پہلے اپنے اعداد و شمار کی خود تصدیق کریں

  • ہر response پر usage پڑھیں، اور output_tokens_details.thinking_tokens کو visible output سے الگ log کریں۔ جو reasoning آپ کو نظر نہیں آتی، اخراجات میں اکثر وہی غیر متوقع مد بنتی ہے۔
  • effort کو واضح طور پر مقرر کریں؛ اسے default پر نہ چھوڑیں۔ prompt caching پر منحصر کسی بھی conversation میں اسے مستقل رکھیں۔
  • پہلے اپنے مستحکم prefix کو cache breakpoint کے پیچھے رکھیں۔ base input price کے دسویں حصے پر cache read کی لاگت زیادہ تر model downgrades سے زیادہ بچت فراہم کرتی ہے۔
  • جس کام کے لیے فوری جواب درکار نہ ہو، اسے Batch API میں منتقل کریں۔
  • متبادل کی لاگت کا دیانت داری سے اندازہ لگائیں۔ اپنے workload پر Claude اور ChatGPT API pricing کا موازنہ طویل مدت کی commitment سے پہلے ایک دوپہر صرف کرنے کے قابل ہے۔

اگر workload اپنے server پر چلنے والا agent ہے تو سب سے اہم controls، model choice سے باہر ہوتے ہیں۔ VPS پر agent کے اخراجات قابو میں رکھنا ان loop limits اور spend caps کی وضاحت کرتا ہے جو بے قابو session کو روکتے ہیں، جبکہ Claude Code دراصل tokens کہاں خرچ کرتا ہے ان اعداد و شمار کی وضاحت کرتا ہے جو آپ اپنے usage dashboard میں دیکھیں گے۔

FAQ

Claude Fable 5 کی فی ملین tokens قیمت کتنی ہے؟

Anthropic کے pricing page پر 3 August 2026 کو جانچنے کے مطابق Claude API میں Claude Fable 5 کی قیمت فی ملین input tokens $10 اور فی ملین output tokens $50 ہے۔ cache read کی قیمت فی ملین tokens $1 ہے، جو بنیادی input rate کا دسواں حصہ ہے۔ Batch API دونوں اقسام پر 50% رعایت دیتا ہے، اس لیے asynchronous کام کے لیے قیمت فی ملین tokens $5 اور $25 بنتی ہے۔ inference_geo parameter کے ذریعے inference کو United States کے اندر رکھنے سے ہر category پر 1.1 گنا multiplier لاگو ہوتا ہے۔

کیا Claude Fable 5، Claude Pro subscription میں شامل ہے؟

Anthropic کے Claude Fable page پر یہ model Pro، Max، Team اور Enterprise users کے لیے دستیاب درج ہے، جبکہ free plan کا نام نہیں دیا گیا۔ شامل access unlimited نہیں ہے۔ کچھ seats میں Fable ہفتہ وار usage limits کے حصے کے طور پر دستیاب ہوتا ہے، جبکہ دیگر seats میں یہ usage credits کے ذریعے دستیاب ہوتا ہے۔ یہ انتظام July 2026 کے دوران ایک سے زیادہ مرتبہ بدلا۔ جس دن فیصلہ کریں، Anthropic کے pricing page پر plan comparison table میں Fable والی row پڑھیں۔ کسی article میں دی گئی figure پر انحصار نہ کریں۔ شامل allowance ختم ہونے کے بعد مزید usage API rate کے مطابق bill ہوتی ہے۔

Claude Fable 5 کا bill نظر آنے والی output سے زیادہ کیوں ہے؟

Claude Fable 5 میں adaptive thinking ہمیشہ فعال رہتی ہے۔ thinking tokens کو output tokens کے طور پر bill کیا جاتا ہے، اور raw chain of thought کبھی واپس نہیں کی جاتی۔ thinking.display کی default قدر omitted ہونے پر آپ کو thinking field خالی نظر آتی ہے، لیکن اس کے پیچھے موجود ہر reasoning token کی ادائیگی ہوتی ہے۔ Response میں usage.output_tokens_details.thinking_tokens پڑھ کر یہ تقسیم دیکھیں۔ یہ بھی نوٹ کریں کہ streaming کے دوران یہ صرف آخری message_delta event میں موصول ہوتی ہے۔ اگر reasoning اور answer کا تناسب task کی ضرورت سے زیادہ ہو تو effort level کم کریں۔

کیا مجھے Claude Fable 5 استعمال کرنا چاہیے یا Claude Opus 5؟

Claude Opus 5 فی token نصف قیمت رکھتا ہے اور اس کی reliable knowledge cutoff زیادہ حالیہ ہے: Fable 5 کے لیے January 2026 کے مقابلے میں Opus 5 کے لیے May 2026۔ ابتدا Opus 5 سے کریں اور صرف اس وقت Fable 5 پر جائیں جب task وہاں ناکام ہو، یا غلط answer کی لاگت price difference سے زیادہ ہو۔ Fable 5 طویل مدتی agent work کے لیے موزوں ہے، جہاں ایک غلط branch کی اصلاح میں کئی گھنٹے لگ سکتے ہیں۔ یہ ان one off jobs کے لیے بھی مناسب ہے جن کا premium ہر request پر ہمیشہ لاگو ہونے کے بجائے ایک ہی invoice پر آتا ہے۔

#claude#fable#model-selection#pricing#tokens