راهنمای انتخاب مدل Claude و مقایسه هزینهها (2026)
کدام مدل Claude برای پروژه شما به صرفهتر است؟ بررسی نرخهای API در جولای 2026 برای Opus 4.8، Sonnet 5 و Haiku 4.5 به همراه تحلیل هزینه اجرای 100,000 درخواست متوالی.
از کدام مدل Claude استفاده کنم؟
پاسخ کوتاه به این پرسش که از کدام مدل Claude استفاده کنید این است: با Claude Opus 4.8 شروع کنید و تنها زمانی آن را تغییر دهید که دلیل مشخصی برای این کار داشته باشید. راهنمایی Anthropic نیز همین است: «اگر مطمئن نیستید از کدام مدل استفاده کنید، برای کدنویسیهای پیچیدهٔ عاملی (agentic) و کارهای سازمانی، با Claude Opus 4.8 شروع کنید.» زمانی که وظیفه بهخوبی تعریف شده است و آن را چندین بار در روز اجرا میکنید، به سراغ Claude Sonnet 5 بروید. برای کارهای مکانیکی و با حجم بالا که از قبل میدانید پاسخ صحیح چگونه است، به سراغ Claude Haiku 4.5 بروید. Claude Fable 5 برای عاملهای طولانیمدت، بالاتر از همهٔ اینها قرار میگیرد.
این انتخاب هزینهای به همراه دارد. اینها نرخهای API (رابط برنامهنویسی اپلیکیشن) Claude تا تاریخ 23 July 2026، به ازای هر میلیون توکن هستند که در مستندات با عنوان MTok نوشته میشود.
- Claude Fable 5 (
claude-fable-5): 10 دلار به ازای هر MTok ورودی، 50 دلار به ازای هر MTok خروجی. کانتکست 1M. - Claude Opus 4.8 (
claude-opus-4-8): 5 دلار ورودی، 25 دلار خروجی. کانتکست 1M. - Claude Opus 4.7 (
claude-opus-4-7): 5 دلار ورودی، 25 دلار خروجی. کانتکست 1M. - Claude Sonnet 5 (
claude-sonnet-5): 2 دلار ورودی، 10 دلار خروجی با قیمتگذاری مقدماتی تا 31 August 2026. نرخ استاندارد 3 دلار ورودی و 15 دلار خروجی از تاریخ 1 September 2026 اعمال میشود. کانتکست 1M. - Claude Haiku 4.5 (
claude-haiku-4-5): 1 دلار ورودی، 5 دلار خروجی. کانتکست 200K.
این شناسهها همانطور که نوشته شدهاند کامل هستند. هیچ چیزی به آنها اضافه نمیشود.
در مدلهایی که ظرفیت 1M توکن دارند، خود اندازه درخواست هیچ هزینه اضافی ایجاد نمیکند: «هزینه یک درخواست 900k توکنی با همان نرخ هر توکن یک درخواست 9k توکنی محاسبه میشود.» این نرخها فقط به API محدود نیستند، زیرا Claude Enterprise میزان استفاده را بر اساس نرخهای API محاسبه میکند و این هزینه را علاوه بر قیمت هر seat دریافت میکند؛ بنابراین، تمام محاسبات زیر برای تیمی با طرح مبتنی بر seat نیز یکسان است. اشتراک با نرخ ثابت معیار محاسبه را تغییر میدهد، اما این تصمیم را تغییر نمیدهد، زیرا هر دو tier از Claude Max همان مدلها را ارائه میکنند و فقط در میزان استفاده قابلدسترسی تفاوت دارند. در سطح پایینتر همین مسیر، هزینه ماهانه $20 در Claude Pro یک سهمیه استفاده است، نه نرخ مبتنی بر هر توکن؛ بنابراین چیزی که در آنجا شما را متوقف میکند، reset شدن محدودیت است، نه دریافت صورتحساب. اگر در حال حاضر در این وضعیت هستید، مشخصکردن اینکه منتظر کدام window هستید باید پیش از هرگونه محاسبه زیر انجام شود، زیرا راهحل، استفاده از مدل کوچکتر، context کوچکتر یا انتقال به API است، نه انتخاب نرخ ارزانتر. اگر هنوز پرداختی را شروع نکردهاید، ارزشداشتن Pro در برابر $20 از ابتدا بر اساس این تعیین میشود که محدودیت رایگان چند وقت یکبار مانع شما میشود، نه بر اساس هیچیک از نرخهای بالا.
کاربرد واقعی هر مدل
شرکت Anthropic برای هر مدل در این مجموعه یک توصیف تکخطی ارائه میدهد که راهنمای بهتری نسبت به هر جدول ردهبندی است.
- مدل Claude Fable 5: «هوش نسل بعدی برای عاملهای (agents) طولانیمدت.» این مدل در میان چهار مدل، کندترین نرخ تأخیر (latency) را دارد.
- مدل Claude Opus 4.8: «برای کدنویسی پیچیدهٔ عاملمحور و کارهای سازمانی.» دارای تأخیر متوسط.
- مدل Claude Sonnet 5: «بهترین ترکیب از سرعت و هوش.» سریع.
- مدل Claude Haiku 4.5: «سریعترین مدل با هوشی نزدیک به مرزهای دانش.»
مدل Fable 5 تنها موردی است که در این مقایسه، هیچگاه برای آن هزینهای بر اساس حجم کاری تعیین نشده است و با نرخی دو برابر Opus 4.8، پرسش دربارهٔ اینکه کدام کارها بازدهی 10 دلار ورودی و 50 دلار خروجی دارند، نیازمند پاسخ اختصاصی خود است.
مدل Haiku 4.5 همچنین محدودیتهایی دارد که پیش از قیمت، تعیینکنندهٔ مناسب بودن آن برای یک کار است. پنجرهٔ متنی (context window) آن 200K توکن است، نه 1M؛ بنابراین یک مخزن کد بزرگ یا رونوشت طولانی از یک عامل در آن جای نمیگیرد. حداکثر خروجی آن در Messages API همزمان، 64K توکن است، در حالی که این مقدار برای سایر مدلها 128K است. همچنین تاریخ قطع دانش (knowledge cutoff) قابلاتکای آن فوریه 2025 است، در حالی که سه مدل دیگر در ژانویه 2026 قرار دارند.
انتخاب مدل در یک بار کاری واقعی چه هزینهای برای من دارد؟
هر مدل در این مجموعه، قیمت خروجی را پنج برابر نرخ ورودی خود تعیین کرده است. قیمت Opus 4.8 برابر با 5 دلار برای ورودی و 25 دلار برای خروجی است. قیمت Haiku 4.5 برابر با 1 دلار برای ورودی و 5 دلار برای خروجی است. این نسبت در تمام مدلها برقرار است، بنابراین مدل انتخابی شما بیشترین تأثیر را بر کارهایی دارد که خروجی زیادی تولید میکنند.
کارهای عاملی (Agentic) از این نوع هستند، زیرا توکنهای تفکر (thinking tokens) به عنوان توکنهای خروجی محاسبه میشوند و حتی زمانی که متن هرگز به دست شما نمیرسد، در max_tokens لحاظ میشوند. در Fable 5، Opus 4.8، Opus 4.7 و Sonnet 5، خلاصه استدلال بهطور پیشفرض حذف میشود، بنابراین فیلد thinking خالی برمیگردد. هزینه تغییری نمیکند: "در هر صورت، این بلوک به یک شکل محاسبه شده و در گفتگوهای چندمرحلهای به همان شکل بازگردانده میشود." مقاله چه چیزی واقعاً صورتحساب توکن Claude را پر میکند این سازوکار محاسبه را بهطور کامل کالبدشکافی میکند.
اینکه آیا فرآیند تفکر اصلاً اجرا میشود یا خیر، بین مدلهایی که مقایسه میکنید متفاوت است؛ اگر به این نکته توجه نکنید، تست هزینه شما بینتیجه خواهد بود. در Sonnet 5 و Fable 5، قابلیت تفکر از قبل فعال است و نیازی به پیکربندی ندارد. در Opus 4.8 و Opus 4.7، این قابلیت تا زمانی که thinking: {type: "adaptive"} را در درخواست تنظیم نکنید، غیرفعال است. پیش از آنکه بخواهید اعداد را تحلیل کنید، پیکربندی هر دو طرف را یکسانسازی کنید.
چرا ارزانترین مدل میتواند گرانترین باشد
یک وظیفهٔ برنامهنویسی مستقل را در نظر بگیرید. درخواست شامل 60,000 توکن متن زمینه (context) است و مدل 8,000 توکن خروجی شامل مراحل تفکر تولید میکند. بدون استفاده از قابلیت caching، محاسبات به این صورت است.
در مدل Opus 4.8: هزینه 0.06 میلیون توکن ورودی با نرخ $5 برابر با $0.30 و 0.008 میلیون توکن خروجی با نرخ $25 برابر با $0.20 است. این تلاش در مجموع $0.50 هزینه دارد. در مدل Haiku 4.5 همان تلاش $0.06 برای ورودی و $0.04 برای خروجی، یعنی در مجموع $0.10 هزینه خواهد داشت.
مدل Haiku در هر تلاش پنج برابر ارزانتر است؛ این تفاوت در نگاه اول فضای مانور زیادی ایجاد میکند، اما باید دید که یک تلاش ناموفق چه پیامدهایی دارد. شما پاسخ اشتباه را میخوانید که باعث اتلاف وقتتان میشود. سپس آن را به عنوان بخشی از متن زمینه در تلاش مجدد ارسال میکنید، بنابراین هر تلاش نسبت به قبلی بزرگتر میشود. و زمانی که تلاش سوم همچنان با خطا مواجه شود، در نهایت مجبور به ارتقای مدل میشوید: $0.30 هزینه Haiku به علاوه $0.50 هزینه Opus برابر با $0.80 میشود، یعنی 60 درصد گرانتر از اجرای یکبارهٔ Opus.
بنابراین، پرسش تعیینکننده این است که با چه هزینهای میتوانید پاسخ را بررسی کنید. زمانی که تشخیص پاسخ اشتباه در یک ثانیه ممکن باشد، مدل کوچکتر یک انتخاب اقتصادی است. اما زمانی که تشخیص خطا مستلزم بررسی دقیق یک diff باشد، مدل کوچکتر هزینهای از زمان شما میگیرد که هرگز در صورتحساب ظاهر نمیشود.
مواردی که مدل کوچکتر برتری مطلق دارد
مدل Haiku 4.5 در موارد زیر انتخاب مناسبی است:
- کارهای مکانیکی توسط subagent. یک subagent که فایلها را تغییر نام میدهد یا خروجی جستجو را جمعآوری میکند، نیازی به استدلال در سطح frontier ندارد. این الگوی استاندارد پس از آن است که شما یک AI agent با Claude میسازید و به آن دستیار میدهید.
- تریاژ لاگ. تصمیمگیری درباره اینکه یک خط لاگ نویز است یا ارزش توجه انسان را دارد، یک قضاوت محدود با حالت شکست مشخص است.
- دستهبندی بر اساس مجموعهای از برچسبهای ثابت. خروجی کوتاه است و دقت آن روی یک نمونه قابل اندازهگیری است.
- فراخوانیهای تولیدی با حجم بالا. در 100,000 اجرا در روز، اختلاف هزینه به ازای هر توکن دیگر یک خطای گرد کردن ساده نیست. این شکل معمولِ گردشکارهای AI متصل به n8n است.
- هر موردی که سرعت پاسخدهی برای کاربر اهمیت دارد. Haiku 4.5 سریعترین مدل در این سری شناخته میشود.
یک محدودیت مشخصاً مربوط به Haiku است. حداقل مقدار prompt قابل کش (cacheable) در آن 4,096 توکن است، در حالی که این مقدار برای Opus 4.8 و Sonnet 5 برابر با 1,024 توکن است. زیر این حداقل، «هر درخواستی برای کش کردن تعداد توکنی کمتر از این مقدار، بدون کش شدن پردازش میشود و هیچ خطایی نیز بازگردانده نمیشود». یک بلوک دستورالعمل 1,500 توکنی که روی Sonnet 5 کش میشود، روی Haiku 4.5 بدون هیچ پیامی کش نمیشود. نشانه آن این است که cache_creation_input_tokens و cache_read_input_tokens هر دو روی صفر باقی میمانند، که مبحث کاهش هزینههای یک agent همیشه روشن به همراه سایر روشهای از دست دادن کش، به آن میپردازد.
اهرمهایی که پاسخ را تغییر میدهند
هر یک از این موارد، تأثیر بیشتری نسبت به نام مدل بر خروجی نهایی دارد.
تلاش (Effort). پارامتر output_config.effort کنترل میکند که مدل پیش از ارائه پاسخ، چه مقدار پردازش انجام دهد. سطوح موجود عبارتند از low، medium، high، xhigh و max، که high مقدار پیشفرض است: «تنظیم effort روی high دقیقاً همان رفتاری را ایجاد میکند که حذف کامل پارامتر effort دارد.» این پارامتر به جای قرارگیری در سطح بالای درخواست، درون output_config جای میگیرد:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)پارامتر Effort بر تمام توکنهای پاسخ تأثیر میگذارد: «این پارامتر میتواند بر کل مصرف توکن، از جمله فراخوانی ابزارها (tool calls) اثر بگذارد. برای مثال، تلاش کمتر به این معناست که Claude تعداد کمتری ابزار فراخوانی میکند.» این موضوع در یک حلقه عاملی (agentic loop) تشدید میشود. این پارامتر یک سقف توکن نیست: «Effort یک سیگنال رفتاری است، نه یک بودجه توکن سختگیرانه.» شرکت Anthropic هیچ ضریب هزینهای برای هر سطح منتشر نکرده و توصیه میکند مورد استفاده خود را آزمایش کنید؛ بنابراین اجرای Sonnet 5 در سطح high در مقایسه با اجرای Opus 4.8 در سطح low، یک مقایسه واقعی است که میتوانید همین امروز بعدازظهر انجام دهید. مدل Haiku 4.5 در لیست مدلهایی که از Effort پشتیبانی میکنند، وجود ندارد.
کش کردن پرامپت (Prompt caching). خواندن از کش، 0.1 برابر نرخ ورودی پایه هزینه دارد و عددی که انتخاب مدل را تعیین میکند، عملکرد آن در سطوح مختلف است. هزینه یک Cache hit برای Opus 4.8 برابر با $0.50 در هر میلیون توکن (MTok) است، در حالی که هزینه ورودی بدون کش برای Haiku 4.5 برابر با $1 در هر میلیون توکن است؛ بنابراین یک پیشوند Opus که بهخوبی کش شده باشد، به ازای هر توکن ورودی ارزانتر از یک پرامپت سرد در Haiku است. در هر حجم کاری که نیاز به ارسال مجدد یک پیشوند بزرگ و ثابت دارد، رعایت بهداشت نشست (Session hygiene) بر انتخاب مدل ارجحیت دارد.
دستهها (Batches). اگر نیازی به دریافت فوری پاسخ نباشد، API مربوط به Message Batches همان مدلها را با «50 درصد تخفیف برای توکنهای ورودی و خروجی» اجرا میکند. این کار هزینه هر ردیف در مقایسه زیر را نصف میکند و در تمام سطوح مدلها کارایی دارد: یک پردازش دستهای (batched) با Opus 4.8، از تاریخ 1 سپتامبر 2026 با قیمت استاندارد، ارزانتر از یک پردازش همگام (synchronous) با Sonnet 5 تمام میشود؛ در واقع شما با همان هزینه، تأخیر را فدای توانمندی بیشتر میکنید.
مقایسه هزینه یک حجم کاری
حجم کاری: دستهبندی 100,000 ایمیل پشتیبانی، هر کدام یک فراخوانی، 2,000 توکن ورودی و 300 توکن خروجی برای هر فراخوانی. این یعنی 200 MTok ورودی و 30 MTok خروجی.
- Haiku 4.5: 200 x $1 = $200 ورودی، 30 x $5 = $150 خروجی. مجموع $350.
- Sonnet 5، نرخ مقدماتی: 200 x $2 = $400 ورودی، 30 x $10 = $300 خروجی. مجموع $700.
- Sonnet 5، از 1 سپتامبر 2026: 200 x $3 = $600 ورودی، 30 x $15 = $450 خروجی. مجموع $1,050.
- Opus 4.8: 200 x $5 = $1,000 ورودی، 30 x $25 = $750 خروجی. مجموع $1,750.
چهار عدد را تغییر دهید تا محاسبات با قیمتهای فردا دوباره انجام شود. تعدیلهای زیر نتیجه را بیش از نام مدل تغییر میدهند:
- دستهبندی (Batching) هر سطر را نصف میکند: $175، $350، $525 و $875. هیچچیز در اجرای دستهبندی شبانه منتظر نمیماند، بنابراین دلیلی برای صرفنظر از آن وجود ندارد.
- کش کردن پیشوند مشترک. فرض کنید 1,200 توکن از 2,000 توکن ورودی، در هر بار همان بلوک دستورالعمل ثابت باشد. در Sonnet 5 با نرخ مقدماتی، این توکنها به عنوان cache hit با قیمت $0.20 به ازای هر MTok محاسبه میشوند، نه $2 به ازای هر MTok؛ بنابراین 120 MTok هزینه $24 خواهد داشت به جای $240. با افزودن 80 MTok ورودی جدید با قیمت $2 که میشود $160، به علاوه $300 خروجی، هزینه Sonnet 5 به جای $700 به حدود $484 میرسد. همین ترفند روی Haiku 4.5 هیچ اثری ندارد، زیرا 1,200 توکن کمتر از حداقل 4,096 توکن مورد نیاز آن است.
- تلاش مجدد (Retries). فرض کنید پاسخ Haiku را در 8 درصد ایمیلها رد میکنید و آنها را دوباره با Opus 4.8 اجرا میکنید. 0.08 x $1,750 = $140 را به $350 اضافه کنید که میشود $490. نرخ رد کردن خود را اندازه بگیرید و از نرخ من استفاده نکنید.
- تعریف ابزارها، اگر کار از آنها استفاده میکند. پرامپت سیستمی که آنها تولید میکنند در Opus 4.8 با تنظیم
tool_choiceرویautoبرابر با 290 توکن، در Sonnet 5 برابر با 354 توکن و در Haiku 4.5 برابر با 496 توکن است. ارزانترین مدل، بیشترین سربار ثابت را تحمیل میکند.
هزینه Haiku با مسیر ارجاع (escalation path) برابر با $490 و هزینه Sonnet 5 با استفاده از کش برابر با $484 تقریباً یکسان است و یکی از آنها کار را در یک مرحله انجام میدهد. مدل هرگز تمام مسئله نبوده است.
آیا تغییر مدل در میان یک نشست باعث صرفهجویی در هزینه میشود؟
کمتر از آنچه قیمتهای اسمی نشان میدهند، زیرا صرفهجویی بهازای هر توکن محاسبه میشود و آنچه به خطر میاندازید، کل یک پیشوند (prefix) کششده است.
شرکت Anthropic مواردی که باعث ابطال کش میشوند را مستند کرده است. پیشوندها به ترتیب tools، سپس system و در نهایت messages ساخته میشوند و «تغییر در هر سطح، آن سطح و تمام سطوح بعدی را باطل میکند.» دو تنظیمات درخواست نیز در آن لیست قرار دارند: «پیکربندی تفکر (thinking configuration) و سطح حلشده effort در خود پرامپت رندر میشوند، بنابراین تغییر هر یک از آنها باعث شروع یک پیشوند کش جدید میشود.» در مورد effort، مستندات فراتر میروند: «بهجای تغییر در حین مکالمهای که به hit شدن کش متکی است، effort را در بارهای کاری مختلف تغییر دهید.»
مدل در آن لیست مستندشده قرار ندارد، بنابراین در مورد آن هیچ فرضی نکنید. در اولین درخواست پس از تغییر مدل، cache_read_input_tokens را بخوانید و اجازه دهید اعداد پاسخ را به شما بدهند. برای یک پیشوند Opus 4.8 با حجم 150,000 توکن، خواندن از کش حدود 0.08 دلار و نوشتن تازه حدود 0.94 دلار هزینه دارد که از اختلاف قیمت چند نوبتِ توکنهایی که بهدنبال صرفهجویی در آنها بودید، بیشتر است.
بنابراین این تغییرات را بین وظایف انجام دهید، نه در حین انجام یک وظیفه. در Claude Code، این یعنی ابتدا /clear را انجام دهید، زمانی که کش بههرحال در حال دور ریخته شدن است، و سپس /model یا /effort را تغییر دهید. هر دوی اینها در CLI تایپ میشوند، بنابراین اگر با Linux کار میکنید، نصب نسخهای که ارزشش را دارد نسخه ترمینال است، زیرا آنچه Anthropic بهصورت بومی برای Linux ارائه میدهد یک CLI پایدار را با یک اپلیکیشن دسکتاپ که هنوز در مرحله بتا است، جفت میکند. اینکه آیا این جابهجایی اصلاً در صورتحساب ظاهر میشود یا خیر، به نحوه پرداخت شما برای آن نشست بستگی دارد، زیرا Claude Code یا با طرح ماهانه ثابت اجرا میشود یا با اعتبار API بهازای هر توکن و تنها در حالت دوم است که تغییر مدل با دلار قیمتگذاری میشود.
نحوه تست پاسخ روی workload اختصاصی خود
اندازه پرامپت را با شمارشی که از مدل دیگری گرفته شده است، تعیین نکنید. استفاده از endpoint شمارش توکن رایگان است و با tokenizer همان مدلی که نام میبرید محاسبه میکند؛ بنابراین مدلی را که قصد فراخوانی آن را دارید، مشخص کنید. آن endpoint یکی از معدود بخشهای پلتفرم است که هرگز هزینهای ندارد و بررسی سایر مواردی که میتوانید بدون پرداخت هزینه اجرا کنید پیش از صرف اعتبار واقعی برای مقایسه، ارزشمند است. مدلهای Opus 4.7 و نسخههای بعد از آن، Fable 5 و Sonnet 5 از tokenizer جدیدتری استفاده میکنند که «برای متن یکسان، تقریباً 30% توکن بیشتری تولید میکند»؛ بنابراین بودجهای که بر اساس یک مدل قدیمی اندازهگیری شده است، در مدل جدید با نرخ ثابت به ازای هر توکن، کمتر از مقدار واقعی به نظر میرسد.
سپس خروجی بازگشتی را مطالعه کنید. input_tokens فقط شامل باقیمانده غیرکششده (uncached) است، بنابراین اندازه واقعی پرامپت برابر است با آن فیلد به علاوه cache_creation_input_tokens و cache_read_input_tokens. اولین اپلیکیشن Claude API روی یک VPS کوچکترین محیط صادقانهای است که میتوانید این اندازهگیری را در آن انجام دهید، و اینکه کدام طرح Claude با میزان استفاده شما متناسب است تصمیمی جداگانه درباره این است که آیا اصلاً باید به ازای هر توکن هزینه پرداخت کنید یا خیر. اگر مشخص شد که مسئله انتخاب نوع اشتراک است و نه لزوماً داشتن یا نداشتن آن، مقایسه قیمت سطوح Claude در کنار ChatGPT هزینههای انجام کار برنامهنویسی مشابه در سرویسدهنده دیگر را پوشش میدهد. اگر این اندازهگیری باعث میشود کار خود را برای همیشه به API منتقل کنید، کاهش سطح اشتراک یا لغو کامل آن همچنان دوره زمانیای را که قبلاً برای آن پرداخت کردهاید برای شما باقی میگذارد، بنابراین پس از مشخص شدن اعداد و ارقام، هیچ جریمهای برای تصمیمگیری وجود ندارد.
FAQ
کدام مدل Claude برای کدنویسی مناسبتر است؟
مدل Claude Opus 4.8 نقطه شروع مستند برای کدنویسی عاملی (agentic) پیچیده است که تا ژوئیه 2026، هزینه آن 5 دلار به ازای هر میلیون توکن ورودی و 25 دلار به ازای هر میلیون توکن خروجی است. مدل Claude Sonnet 5 به عنوان بهترین ترکیب از سرعت و هوشمندی شناخته میشود و با قیمت 2 دلار / 10 دلار تا 31 اوت 2026، کمتر از نصف مدل قبلی هزینه دارد. یک تسک مشابه را روی هر دو اجرا کنید، پیکربندی thinking را ثابت نگه دارید و مجموع هزینه توکنها را از response.usage مقایسه کنید.
آیا Claude Haiku 4.5 به اندازه کافی ارزان است که جایگزین Sonnet 5 شود؟
از نظر هزینه هر توکن، بله: 1 دلار / 5 دلار در مقایسه با 2 دلار / 10 دلار برای Sonnet 5 در قیمتگذاری اولیه، یا 3 دلار / 15 دلار از 1 سپتامبر 2026. محدودیتها تعیینکننده هستند. مدل Haiku 4.5 دارای پنجره کانتکست 200K توکنی به جای 1M، حداکثر خروجی 64K در Messages API همگام، تاریخ دانش قابل اتکای فوریه 2025، عدم پشتیبانی از output_config.effort و حداقل پرامپت قابل کش (cacheable) 4,096 توکنی است که در پرامپتهای کوتاه سیستم، کش را بهطور خودکار غیرفعال میکند.
آیا تغییر مدل Claude به مدلی ارزانتر در میانه نشست (session)، باعث صرفهجویی در هزینه میشود؟
کمتر از آنچه به نظر میرسد. Anthropic ابطالکنندههای کش را به عنوان تغییر در پیشوند tools، system یا messages، تغییر در پیکربندی thinking و تغییر در output_config.effort مستند کرده است. تأثیر تغییر مدل بر کش موجود مستند نشده است، بنابراین آن را ناشناخته فرض کنید و cache_read_input_tokens را در اولین درخواست پس از آن بررسی کنید. ارزش این موضوع مشخص است: روی یک پیشوند 150,000 توکنی Opus 4.8، خواندن از کش حدود 0.08 دلار و نوشتن تازه حدود 0.94 دلار هزینه دارد که از صرفهجویی چند دورِ هزینه هر توکن بیشتر است. تغییر مدل را بین تسکها و پس از /clear در Claude Code انجام دهید، یعنی زمانی که کش در هر صورت دور ریخته میشود.
پارامتر output_config.effort چه تأثیری بر صورتحساب من دارد؟
این پارامتر تعداد توکنهایی را که مدل در متن، فراخوانی ابزارها و thinking صرف میکند، تغییر میدهد. تلاش (effort) کمتر باعث فراخوانیهای ابزار کمتری میشود که در حلقههای عاملی (agentic loops) تأثیر مضاعف دارد، زیرا هر نتیجه ابزار در دورهای بعدی مجدداً ارسال میشود. سطوح شامل low، medium، high، xhigh و max است و high به عنوان پیشفرض در نظر گرفته میشود. Anthropic هیچ ضریب هزینهای برای هر سطح منتشر نکرده و effort را یک سیگنال رفتاری میداند تا بودجه توکن؛ بنابراین آن را روی تسک خودتان اندازهگیری کنید.
استفاده از Claude Batches API چقدر صرفهجویی دارد؟
50 درصد در توکنهای ورودی و خروجی، در ازای تحویل غیرهمگام (asynchronous). تا ژوئیه 2026، این موضوع هزینه Opus 4.8 را به 2.50 دلار ورودی / 12.50 دلار خروجی، Sonnet 5 را به 1 دلار / 5 دلار در قیمتگذاری اولیه و Haiku 4.5 را به 0.50 دلار / 2.50 دلار میرساند. مقایسهای که ارزش توجه دارد در سطوح مختلف است: یک تسک دستهای (batched) با Opus 4.8 کمتر از یک تسک همگام با Sonnet 5 با نرخ استاندارد از 1 سپتامبر 2026 هزینه دارد؛ بنابراین batching به شما امکان میدهد با همان هزینه، از مدل قدرتمندتری استفاده کنید.