کدام مدل Claude برای کار من مناسب است؟
مقایسه هزینه مدلهای Claude Opus 4.8، Sonnet 5 و Haiku 4.5 در جولای 2026. محاسبه دقیق هزینهها برای 100,000 درخواست و بررسی نرخهای MTok در API.
از کدام مدل Claude استفاده کنم؟
پاسخ کوتاه به این سوال که از کدام مدل Claude استفاده کنید: با Claude Opus 4.8 شروع کنید و تنها در صورتی از آن صرفنظر کنید که دلیل مشخصی داشته باشید. راهنمای Anthropic نیز همین است: «اگر در مورد انتخاب مدل تردید دارید، برای کارهای پیچیده برنامهنویسی مبتنی بر Agent و کارهای سازمانی، از Claude Opus 4.8 استفاده کنید.» زمانی که وظیفه کاملاً مشخص است و آن را بارها در روز اجرا میکنید، به Claude Sonnet 5 بروید. برای کارهای مکانیکی و با حجم بالا که از شکل پاسخ صحیح آنها آگاه هستید، از Claude Haiku 4.5 استفاده کنید. Claude Fable 5 برای Agentهای با فعالیت طولانیمدت، بالاتر از همه آنها قرار دارد.
این انتخاب هزینهای دارد. نرخهای زیر مربوط به Claude API (application programming interface) تا تاریخ 23 July 2026، به ازای هر میلیون توکن است که در مستندات با نام MTok نمایش داده میشود.
- Claude Fable 5 (
claude-fable-5): $10 / MTok ورودی، $50 / MTok خروجی. 1M context. - Claude Opus 4.8 (
claude-opus-4-8): $5 ورودی، $25 خروجی. 1M context. - Claude Opus 4.7 (
claude-opus-4-7): $5 ورودی، $25 خروجی. 1M context. - Claude Sonnet 5 (
claude-sonnet-5): $2 ورودی، $10 خروجی با قیمتهای آزمایشی تا 31 August 2026. نرخ استاندارد $3 ورودی، $15 خروجی از 1 September 2026 اعمال میشود. 1M context. - Claude Haiku 4.5 (
claude-haiku-4-5): $1 ورودی، $5 خروجی. 200K context.
این شناسهها دقیقاً به همین صورت هستند. هیچ چیزی به آنها اضافه نمیشود.
حجم درخواست در مدلهای 1M-token شامل هزینه اضافی نمیشود: «یک درخواست 900k-token با همان نرخ هر توکنِ یک درخواست 9k-token محاسبه میشود.»
کاربرد واقعی هر مدل
Anthropic کاربرد هر مدل را در یک خط توضیح میدهد؛ این توضیحات بهتر از هر جدول رتبهبندی راهنما هستند.
- Claude Fable 5: "هوش نسل جدید برای عاملهای (agents) با فعالیت طولانیمدت." از نظر تأخیر (latency)، کندترین مدل در میان این چهار مدل است.
- Claude Opus 4.8: "برای کدنویسی عاملمحور پیچیده و کارهای سازمانی." تأخیر متوسط.
- Claude Sonnet 5: "بهترین ترکیب از سرعت و هوش." سریع.
- Claude Haiku 4.5: "سریعترین مدل با هوشی نزدیک به مدلهای پیشرو (frontier)."
مدل Haiku 4.5 محدودیتهایی دارد که قبل از قیمت، مناسب بودن آن را برای یک وظیفه تعیین میکند. پنجره بافت (context window) آن به جای 1M، برابر با 200K توکن است؛ بنابراین یک مخزن کد (repository) بزرگ یا یک متن طولانی از فعالیت عاملها در آن جای نمیگیرد. حداکثر خروجی آن در Messages API همگرا (synchronous) برابر با 64K توکن است، در حالی که برای سایر مدلها 128K توکن است. همچنین تاریخ قطع دانش (knowledge cutoff) قابل اعتماد آن February 2025 است، در حالی که سه مدل دیگر در January 2026 قرار دارند.
انتخاب مدل چه هزینهای برای بار کاری واقعی دارد؟
قیمتگذاری خروجی در تمام مدلهای این سری، 5 برابر نرخ ورودی است. در مدل Opus 4.8، هزینه ورودی 5 دلار و هزینه خروجی 25 دلار است. در مدل Haiku 4.5، هزینه ورودی 1 دلار و هزینه خروجی 5 دلار است. این نسبت در تمام طیف مدلها برقرار است؛ بنابراین انتخاب مدل در کارهایی که حجم خروجی زیادی دارند، اهمیت حیاتی دارد.
کارهای Agentic از این نوع کارها هستند، زیرا توکنهای مربوط به تفکر (thinking tokens) مانند توکنهای خروجی محاسبه میشوند و حتی اگر متن هرگز به شما نرسد، در مجموع max_tokens لحاظ میشوند. در مدلهای Fable 5، Opus 4.8، Opus 4.7 و Sonnet 5، خلاصه استدلال (reasoning summary) به صورت پیشفرض حذف میشود، بنابراین فیلد thinking خالی برمیگردد. نحوه صورتحساب بدون تغییر است: "در هر دو حالت، بلوک به یک شکل محاسبه و در گفتگوهای چند مرحلهای به همان شکل بازگردانده میشود." عامل اصلی هزینههای توکن Claude چیست این موضوع را به طور کامل بررسی میکند.
فعال یا غیرفعال بودن قابلیت thinking در مدلهای مورد مقایسه متفاوت است؛ اگر به این نکته توجه نکنید، تست هزینه شما با شکست مواجه خواهد شد. در مدلهای Sonnet 5 و Fable 5، قابلیت thinking از قبل فعال است و نیاز به تنظیمات ندارد. در مدلهای Opus 4.8 و Opus 4.7، این قابلیت غیرفعال است مگر اینکه thinking: {type: "adaptive"} را در درخواست (request) تنظیم کنید. قبل از تحلیل اعداد، تنظیمات را در هر دو طرف یکسان کنید.
چرا ارزانترین مدل میتواند گرانترین باشد
یک وظیفه برنامهنویسی مستقل را در نظر بگیرید. درخواست شامل 60,000 token از context است و مدل 8,000 token خروجی شامل thinking تولید میکند. بدون استفاده از caching، محاسبات به صورت شفاف باقی میماند.
در Opus 4.8: مقدار 0.06 MTok ورودی با قیمت 5$ برابر با 0.30$ است و 0.008 MTok خروجی با قیمت 25$ برابر با 0.20$ است. هزینه این تلاش 0.50$ است. در Haiku 4.5 همین تلاش شامل 0.06$ به علاوه 0.04$ است، یعنی 0.10$.
هزینه Haiku در هر تلاش 5 برابر ارزانتر است که در ابتدا بسیار مقرونبهصرفه به نظر میرسد، اما کافی است بررسی کنید یک تلاش ناموفق چه پیامدی دارد. شما پاسخ اشتباه را میخوانید که باعث هدر رفت زمان شما میشود. شما پاسخ را در تلاش مجدد به عنوان context ارسال میکنید، بنابراین هر تلاش بزرگتر از تلاش قبلی است. و وقتی تلاش سوم نیز با شکست مواجه شود، شما مجبور به استفاده از مدل قویتر میشوید: 0.30$ از Haiku به علاوه 0.50$ از Opus برابر با 0.80$ است، یعنی 60% بیشتر از اجرای یکباره Opus.
بنابراین سوال تعیینکننده این است که چقدر ارزان میتوانید پاسخ را بررسی کنید. وقتی تشخیص پاسخ اشتباه در یک ثانیه ممکن باشد، مدل کوچک بسیار مقرونبهصرفه است. اما وقتی تشخیص خطا مستلزم خواندن دقیق یک diff باشد، مدل کوچک هزینهای از نظر زمانی به شما تحمیل میکند که هرگز در صورتحساب ظاهر نمیشود.
مواردی که مدلهای کوچکتر برنده مطلق هستند
در موارد زیر، Haiku 4.5 انتخاب مناسبی است:
- کارهای مکانیکی زیر-نماینده (subagent). یک زیر-نماینده که وظیفه تغییر نام فایلها یا جمعآوری خروجی جستجو را دارد، نیازی به استدلال پیشرفته ندارد. این یک الگوی استاندارد پس از آن است که شما یک عامل هوش مصنوعی با Claude بسازید و به آن ابزارهای کمکی اختصاص دهید.
- دستهبندی لاگها (Log triage). تصمیمگیری در مورد اینکه آیا یک خط از لاگ، نویز است یا ارزش توجه انسان را دارد، یک قضاوت محدود با حالتهای شکست مشخص است.
- طبقهبندی بر اساس یک مجموعه برچسب ثابت. خروجی کوتاه است و دقت آن بر روی یک نمونه قابل اندازهگیری است.
- فراخوانیهای تولیدی با حجم بالا. در 100,000 اجرا در روز، اختلاف هزینه بر حسب توکن دیگر یک خطای گرد کردن نیست. این ساختار معمول در گردشکارهای هوش مصنوعی متصل به n8n است.
- هر موردی که سرعت پاسخدهی برای کاربر اهمیت دارد. Haiku 4.5 سریعترین مدل در این مجموعه است.
یک محدودیت مخصوص به Haiku وجود دارد. حداقل اندازه پرامپت قابل کش (cacheable) برای آن 4,096 توکن است، در حالی که این مقدار برای Opus 4.8 و Sonnet 5 برابر با 1,024 توکن است؛ در مقادیر کمتر از این حد، "تمام درخواستها برای تعداد توکنهای کمتر از این مقدار، بدون کش شدن پردازش میشوند و هیچ خطایی برگردانده نمیشود". یک بلوک دستورالعمل 1,500 توکنی که در Sonnet 5 بدون خطا کش میشود، در Haiku 4.5 بدون اطلاع کش نمیشود. نشانهی آن، صفر بودن هر دو مقدار cache_creation_input_tokens و cache_read_input_tokens است، که در کنار سایر روشهای از دست رفتن کش، بر کاهش هزینههای یک عامل همیشه-فعال تأثیر میگذارد.
اهرمهایی که پاسخ را تغییر میدهند
هر یک از این موارد، تأثیر بیشتری نسبت به نام مدل بر هزینه نهایی دارند.
Effort. پارامتر output_config.effort میزان پردازش مدل پیش از پاسخدهی را کنترل میکند. سطوح مختلف شامل low، medium، high، xhigh و max هستند و مقدار پیشفرض high است: "تنظیم effort روی high دقیقاً همان رفتار حذف کامل پارامتر effort را ایجاد میکند." این پارامتر به جای قرارگیری در سطح اصلی درخواست، درون output_config قرار میگیرد:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)پارامتر Effort بر تمام توکنهای پاسخ اثر میگذارد: "این پارامتر میتواند بر تمام هزینههای توکن از جمله tool calls اثر بگذارد. برای مثال، مقدار effort کمتر به این معناست که Claude tool calls کمتری انجام میدهد." این موضوع در یک حلقه agentic اثر مضاعف دارد. این پارامتر محدودیت توکن نیست: "Effort یک سیگنال رفتاری است، نه یک سقف سختگیرانه برای توکن." شرکت Anthropic ضریب هزینه برای هر سطح منتشر نمیکند و توصیه میکند مورد استفاده خود را تست کنید؛ بنابراین مقایسه اجرای Sonnet 5 در سطح high با Opus 4.8 در سطح low، مقایسهای واقعی است که میتوانید امروز انجام دهید. مدل Haiku 4.5 در لیست مدلهای پشتیبانیکننده از effort وجود ندارد.
Prompt caching. هزینه خواندن از cache برابر با 0.1x نرخ پایه ورودی است و عدد تعیینکننده برای انتخاب مدل، بر اساس عملکرد آن در سطوح مختلف است. یک cache hit در مدل Opus 4.8 هزینه 0.50$ / MTok دارد، در حالی که ورودی بدون cache در Haiku 4.5 هزینه 1$ / MTok دارد؛ بنابراین یک prefix کششده در Opus ارزانتر از یک prompt بدون کش در Haiku است. برای هر حجم کاری که یک prefix بزرگ و ثابت را مجدداً ارسال میکند، مدیریت صحیح session از انتخاب مدل مهمتر است.
Batches. اگر پاسخ فوری مورد نیاز نباشد، Message Batches API همان مدلها را با "50% تخفیف روی هر دو توکن ورودی و خروجی" اجرا میکند. این قابلیت هزینه هر ردیف از مقایسه زیر را نصف میکند و در تمامی سطوح کار میکند: یک job در مدل Opus 4.8 به صورت batched، از یک job همزمان در Sonnet 5 با قیمت استاندارد (از 1 September 2026) ارزانتر است؛ در واقع در اینجا با همان هزینه، تأخیر (latency) را فدای توانایی مدل میکنید.
مقایسه هزینه یک مورد کاری
بار کاری: دستهبندی 100,000 ایمیل پشتیبانی، هر ایمیل در یک فراخوانی، شامل 2,000 توکن ورودی و 300 توکن خروجی در هر فراخوانی. این معادل 200 MTok ورودی و 30 MTok خروجی است.
- Haiku 4.5: 200 x $1 = $200 ورودی، 30 x $5 = $150 خروجی. مجموع $350.
- Sonnet 5، نرخ اولیه: 200 x $2 = $400 ورودی، 30 x $10 = $300 خروجی. مجموع $700.
- Sonnet 5، از 1 September 2026: 200 x $3 = $600 ورودی، 30 x $15 = $450 خروجی. مجموع $1,050.
- Opus 4.8: 200 x $5 = $1,000 ورودی، 30 x $25 = $750 خروجی. مجموع $1,750.
برای محاسبه مجدد با قیمتهای فردا، چهار عدد را تغییر دهید. تعدیلات زیر، نتیجه را نسبت به نام مدل تغییر میدهند:
- Batching هزینه هر خط را نصف میکند: $175، $350، $525 و $875. در یک اجرای دستهای شبانه، هیچ پردازشی منتظر نمیماند، بنابراین دلیلی برای نادیده گرفتن آن وجود ندارد.
- Caching پیشوند مشترک. فرض کنید 1,200 توکن از 2,000 توکن ورودی، هر بار یک بلوک دستورالعمل ثابت هستند. در Sonnet 5 با نرخ اولیه، هزینه این توکنها به عنوان cache hits برابر با $0.20 / MTok است، به جای $2 / MTok؛ بنابراین 120 MTok به جای $240، برابر با $24 هزینه دارد. با اضافه کردن 80 MTok ورودی جدید با قیمت $2 (یعنی $160) و $300 خروجی، هزینه Sonnet 5 به جای $700، حدود $484 میشود. این ترفند در Haiku 4.5 تاثیری ندارد، زیرا 1,200 توکن کمتر از حداقل 4,096 توکن آن است.
- Retries. فرض کنید پاسخ Haiku را در 8% از ایمیلها رد کنید و آنها را مجدداً با Opus 4.8 اجرا کنید. مقدار 0.08 x $1,750 = $140 را به $350 اضافه کنید که حاصل $490 میشود. به جای استفاده از عدد من، نرخ رد پاسخ خود را اندازهگیری کنید.
- Tool definitions، اگر کار از آنها استفاده کند. سیستم پرامپت تولید شده توسط آنها در Opus 4.8 با تنظیم
tool_choiceرویautoبرابر با 290 توکن، در Sonnet 5 برابر با 354 توکن و در Haiku 4.5 برابر با 496 توکن است. ارزانترین مدل، بیشترین سربار ثابت را دارد.
Haiku با مسیر ارتقا (escalation path) با هزینه $490 و Sonnet 5 با قابلیت cache با هزینه $484، هزینهای یکسان دارند و یکی از آنها کار را در یک مرحله انجام میدهد. مدل، تمام مسئله نبود.
آیا تغییر مدل در میان یک session باعث صرفهجویی در هزینه میشود؟
کمتر از آنچه قیمتهای اعلام شده نشان میدهند، زیرا صرفهجویی بر اساس هر token محاسبه میشود و آنچه در خطر قرار میگیرد، یک prefix کش شده کامل است.
Anthropic موارد بیاعتباری کش را مستند کرده است. Prefixها به ترتیب tools، سپس system و سپس messages ساخته میشوند و «تغییرات در هر سطح، آن سطح و تمام سطوح بعدی را بیاعتبر میکند.» دو تنظیم درخواست نیز در این لیست هستند: «تنظیمات thinking و سطح resolved effort در خودِ prompt رندر میشوند، بنابراین تغییر هر یک از آنها باعث شروع یک prefix کش جدید میشود.» در مستندات در مورد effort توضیح داده شده است: «به جای تغییر در یک conversation که به cache hits متکی است، effort را در بین workloadهای مختلف تغییر دهید.»
مدل در آن لیست مستند شده نیست، بنابراین هیچ فرضی در این مورد نداشته باشید. در اولین درخواست پس از تغییر، cache_read_input_tokens را بخوانید و اجازه دهید عدد پاسخگو باشد. در یک prefix مدل Opus با 150,000 token، هزینه یک cache read حدود $0.08 و هزینه یک write جدید حدود $0.94 است، که بیشتر از اختلاف قیمت چندین turn در حالت per-token است که به دنبال آن بودید.
بنابراین این موارد را بین وظایف (tasks) تغییر دهید، نه در داخل یک وظیفه. در Claude Code این به معنای ابتدا /clear است، زمانی که کش در حال حذف شدن است، و سپس /model یا /effort.
روش تست پاسخ بر اساس حجم کاری خودتان
اندازهگیری حجم یک prompt بر اساس تعداد توکنهای یک مدل دیگر انجام نشود. استفاده از endpoint محاسبه توکن رایگان است و از tokenizer همان مدلی که نام میبرید استفاده میکند؛ بنابراین مدلی را انتخاب کنید که قصد فراخوانی آن را دارید. مدلهای Opus 4.7 و نسخههای جدیدتر، و همچنین Fable 5 و Sonnet 5 از tokenizer جدیدتری استفاده میکنند که «برای یک متن یکسان، تقریباً 30% توکن بیشتری تولید میکند»؛ بنابراین بودجهای که بر اساس یک مدل قدیمی محاسبه شده باشد، در مدل جدید با نرخ ثابتِ هر توکن، کمتر از مقدار واقعی خواهد بود.
سپس خروجی را بررسی کنید. مقدار input_tokens فقط باقیماندهی بدون cache است، بنابراین حجم واقعی prompt برابر است با این فیلد به علاوه cache_creation_input_tokens به علاوه cache_read_input_tokens. اولین اپلیکیشن Claude API روی یک VPS کوچکترین و دقیقترین مکان برای انجام این اندازهگیری است، و انتخاب طرح Claude متناسب با میزان استفاده شما تصمیمی مجزا در مورد پرداخت هزینه به ازای هر توکن است.
FAQ
کدام مدل Claude برای کدنویسی بهتر است؟
طبق مستندات، Claude Opus 4.8 نقطه شروع برای کدنویسی پیچیده و مبتنی بر عامل (agentic) است. قیمت آن تا July 2026، مبلغ 5 دلار به ازای هر میلیون توکن ورودی و 25 دلار به ازای هر میلیون توکن خروجی است. Claude Sonnet 5 بهترین ترکیب از سرعت و هوشمندی محسوب میشود و تا 31 August 2026، با قیمت 2 دلار / 10 دلار، کمتر از نصف هزینه مدل دیگر است. یک وظیفه یکسان را روی هر دو مدل اجرا کنید، تنظیمات thinking را ثابت نگه دارید و مجموع هزینه توکنها را از response.usage مقایسه کنید.
آیا Claude Haiku 4.5 برای جایگزینی Sonnet 5 به اندازه کافی ارزان هست؟
از نظر هزینه هر توکن، بله: در قیمتگذاری اولیه، 1 دلار / 5 دلار در مقابل 2 دلار / 10 دلار برای Sonnet 5 است، یا از 1 September 2026، قیمت 3 دلار / 15 دلار خواهد بود. اما محدودیتها تعیینکننده هستند. Haiku 4.5 به جای 1M، دارای پنجره بافت (context window) 200K توکن است، حداکثر خروجی 64K در Messages API همگرا دارد، تاریخ قطع دانش معتبر آن February 2025 است، فاقد پشتیبانی output_config.effort است، و دارای حداقل پرامپت قابل کش شدن (cacheable) 4,096 توکن است که باعث غیرفعال شدن بیصدای کش در پرامپتهای سیستمی کوتاه میشود.
آیا تغییر به یک مدل ارزانتر Claude در میان یک نشست (session) باعث صرفهجویی در هزینه میشود؟
کمتر از آنچه به نظر میرسد. Anthropic موارد ابطال کش (cache invalidators) را شامل تغییر در پیشوند tools، system یا messages، تغییر در تنظیمات thinking و تغییر در output_config.effort میداند. تأثیر تغییر مدل بر کش موجود مستند نشده است، بنابراین آن را ناشناخته در نظر بگیرید و در اولین درخواست بعدی، cache_read_input_tokenscache_read_input_tokens را بخوانید. این موضوع اهمیت دارد: در یک پیشوند 150,000 توکنی Opus 4.8، هزینه خواندن از کش حدود 0.08 دلار و هزینه نوشتن مجدد حدود 0.94 دلار است، که از صرفهجویی در چندین مرحله (turn) بر اساس هزینه هر توکن بیشتر است. در Claude Code، پس از /clear، بین وظایف مختلف سوئیچ کنید، زیرا در آن حالت کش بدون توجه به نوع مدل دور ریخته میشود.
پارامتر output_config.effort چه تأثیری بر صورتحساب من دارد؟
این پارامتر نحوه مصرف توکن مدل در متن، فراخوانی ابزار (tool calls) و تفکر (thinking) را تغییر میدهد. میزان effort کمتر، باعث فراخوانی ابزار کمتر میشود که در حلقههای عاملمحور (agentic loops) اثر lũچوی دارد، زیرا نتیجه هر ابزار در مراحل بعدی دوباره ارسال میشود. سطوح آن عبارتند از low، medium، high، xhigh و max که high مقدار پیشفرض است. Anthropic ضریب هزینه برای هر سطح منتشر نمیکند و effort را به جای بودجه توکن، یک سیگنال رفتاری مینامد؛ بنابراین آن را بر اساس وظیفه خود بسنجید.
Claude Batches API چقدر باعث صرفهجویی میشود؟
50% در هر دو توکن ورودی و خروجی، در ازای تحویل غیرهمگرا (asynchronous). تا July 2026، این یعنی Opus 4.8 با قیمت 2.50 دلار ورودی / 12.50 دلار خروجی، Sonnet 5 با قیمت 1 دلار / 5 دلار در قیمتگذاری اولیه، و Haiku 4.5 با قیمت 0.50 دلار / 2.50 دلار. مقایسهای که ارزش توجه دارد در میان سطوح مختلف است: یک کار Opus 4.8 در حالت batch، از یک کار Sonnet 5 همگرا با نرخ استاندارد از 1 September 2026 ارزانتر است؛ بنابراین batching اجازه میدهد با همان هزینه، از مدل قدرتمندتری استفاده کنید.