SSD Nodes Learn
راهنماها Matt Connorتوسط Matt Connor · به‌روزرسانی شده 2026-07-24

کدام مدل Claude برای کار من مناسب است؟

مقایسه هزینه مدل‌های Claude Opus 4.8، Sonnet 5 و Haiku 4.5 در جولای 2026. محاسبه دقیق هزینه‌ها برای 100,000 درخواست و بررسی نرخ‌های MTok در API.

از کدام مدل Claude استفاده کنم؟

پاسخ کوتاه به این سوال که از کدام مدل Claude استفاده کنید: با Claude Opus 4.8 شروع کنید و تنها در صورتی از آن صرف‌نظر کنید که دلیل مشخصی داشته باشید. راهنمای Anthropic نیز همین است: «اگر در مورد انتخاب مدل تردید دارید، برای کارهای پیچیده برنامه‌نویسی مبتنی بر Agent و کارهای سازمانی، از Claude Opus 4.8 استفاده کنید.» زمانی که وظیفه کاملاً مشخص است و آن را بارها در روز اجرا می‌کنید، به Claude Sonnet 5 بروید. برای کارهای مکانیکی و با حجم بالا که از شکل پاسخ صحیح آن‌ها آگاه هستید، از Claude Haiku 4.5 استفاده کنید. Claude Fable 5 برای Agentهای با فعالیت طولانی‌مدت، بالاتر از همه آن‌ها قرار دارد.

این انتخاب هزینه‌ای دارد. نرخ‌های زیر مربوط به Claude API (application programming interface) تا تاریخ 23 July 2026، به ازای هر میلیون توکن است که در مستندات با نام MTok نمایش داده می‌شود.

  • Claude Fable 5 (claude-fable-5): $10 / MTok ورودی، $50 / MTok خروجی. 1M context.
  • Claude Opus 4.8 (claude-opus-4-8): $5 ورودی، $25 خروجی. 1M context.
  • Claude Opus 4.7 (claude-opus-4-7): $5 ورودی، $25 خروجی. 1M context.
  • Claude Sonnet 5 (claude-sonnet-5): $2 ورودی، $10 خروجی با قیمت‌های آزمایشی تا 31 August 2026. نرخ استاندارد $3 ورودی، $15 خروجی از 1 September 2026 اعمال می‌شود. 1M context.
  • Claude Haiku 4.5 (claude-haiku-4-5): $1 ورودی، $5 خروجی. 200K context.

این شناسه‌ها دقیقاً به همین صورت هستند. هیچ چیزی به آن‌ها اضافه نمی‌شود.

حجم درخواست در مدل‌های 1M-token شامل هزینه اضافی نمی‌شود: «یک درخواست 900k-token با همان نرخ هر توکنِ یک درخواست 9k-token محاسبه می‌شود.»

کاربرد واقعی هر مدل

Anthropic کاربرد هر مدل را در یک خط توضیح می‌دهد؛ این توضیحات بهتر از هر جدول رتبه‌بندی راهنما هستند.

  • Claude Fable 5: "هوش نسل جدید برای عامل‌های (agents) با فعالیت طولانی‌مدت." از نظر تأخیر (latency)، کندترین مدل در میان این چهار مدل است.
  • Claude Opus 4.8: "برای کدنویسی عامل‌محور پیچیده و کارهای سازمانی." تأخیر متوسط.
  • Claude Sonnet 5: "بهترین ترکیب از سرعت و هوش." سریع.
  • Claude Haiku 4.5: "سریع‌ترین مدل با هوشی نزدیک به مدل‌های پیشرو (frontier)."

مدل Haiku 4.5 محدودیت‌هایی دارد که قبل از قیمت، مناسب بودن آن را برای یک وظیفه تعیین می‌کند. پنجره بافت (context window) آن به جای 1M، برابر با 200K توکن است؛ بنابراین یک مخزن کد (repository) بزرگ یا یک متن طولانی از فعالیت عامل‌ها در آن جای نمی‌گیرد. حداکثر خروجی آن در Messages API همگرا (synchronous) برابر با 64K توکن است، در حالی که برای سایر مدل‌ها 128K توکن است. همچنین تاریخ قطع دانش (knowledge cutoff) قابل اعتماد آن February 2025 است، در حالی که سه مدل دیگر در January 2026 قرار دارند.

انتخاب مدل چه هزینه‌ای برای بار کاری واقعی دارد؟

قیمت‌گذاری خروجی در تمام مدل‌های این سری، 5 برابر نرخ ورودی است. در مدل Opus 4.8، هزینه ورودی 5 دلار و هزینه خروجی 25 دلار است. در مدل Haiku 4.5، هزینه ورودی 1 دلار و هزینه خروجی 5 دلار است. این نسبت در تمام طیف مدل‌ها برقرار است؛ بنابراین انتخاب مدل در کارهایی که حجم خروجی زیادی دارند، اهمیت حیاتی دارد.

کارهای Agentic از این نوع کارها هستند، زیرا توکن‌های مربوط به تفکر (thinking tokens) مانند توکن‌های خروجی محاسبه می‌شوند و حتی اگر متن هرگز به شما نرسد، در مجموع max_tokens لحاظ می‌شوند. در مدل‌های Fable 5، Opus 4.8، Opus 4.7 و Sonnet 5، خلاصه استدلال (reasoning summary) به صورت پیش‌فرض حذف می‌شود، بنابراین فیلد thinking خالی برمی‌گردد. نحوه صورت‌حساب بدون تغییر است: "در هر دو حالت، بلوک به یک شکل محاسبه و در گفتگوهای چند مرحله‌ای به همان شکل بازگردانده می‌شود." عامل اصلی هزینه‌های توکن Claude چیست این موضوع را به طور کامل بررسی می‌کند.

فعال یا غیرفعال بودن قابلیت thinking در مدل‌های مورد مقایسه متفاوت است؛ اگر به این نکته توجه نکنید، تست هزینه شما با شکست مواجه خواهد شد. در مدل‌های Sonnet 5 و Fable 5، قابلیت thinking از قبل فعال است و نیاز به تنظیمات ندارد. در مدل‌های Opus 4.8 و Opus 4.7، این قابلیت غیرفعال است مگر اینکه thinking: {type: "adaptive"} را در درخواست (request) تنظیم کنید. قبل از تحلیل اعداد، تنظیمات را در هر دو طرف یکسان کنید.

چرا ارزان‌ترین مدل می‌تواند گران‌ترین باشد

یک وظیفه برنامه‌نویسی مستقل را در نظر بگیرید. درخواست شامل 60,000 token از context است و مدل 8,000 token خروجی شامل thinking تولید می‌کند. بدون استفاده از caching، محاسبات به صورت شفاف باقی می‌ماند.

در Opus 4.8: مقدار 0.06 MTok ورودی با قیمت 5$ برابر با 0.30$ است و 0.008 MTok خروجی با قیمت 25$ برابر با 0.20$ است. هزینه این تلاش 0.50$ است. در Haiku 4.5 همین تلاش شامل 0.06$ به علاوه 0.04$ است، یعنی 0.10$.

هزینه Haiku در هر تلاش 5 برابر ارزان‌تر است که در ابتدا بسیار مقرون‌به‌صرفه به نظر می‌رسد، اما کافی است بررسی کنید یک تلاش ناموفق چه پیامدی دارد. شما پاسخ اشتباه را می‌خوانید که باعث هدر رفت زمان شما می‌شود. شما پاسخ را در تلاش مجدد به عنوان context ارسال می‌کنید، بنابراین هر تلاش بزرگتر از تلاش قبلی است. و وقتی تلاش سوم نیز با شکست مواجه شود، شما مجبور به استفاده از مدل قوی‌تر می‌شوید: 0.30$ از Haiku به علاوه 0.50$ از Opus برابر با 0.80$ است، یعنی 60% بیشتر از اجرای یک‌باره Opus.

بنابراین سوال تعیین‌کننده این است که چقدر ارزان می‌توانید پاسخ را بررسی کنید. وقتی تشخیص پاسخ اشتباه در یک ثانیه ممکن باشد، مدل کوچک بسیار مقرون‌به‌صرفه است. اما وقتی تشخیص خطا مستلزم خواندن دقیق یک diff باشد، مدل کوچک هزینه‌ای از نظر زمانی به شما تحمیل می‌کند که هرگز در صورت‌حساب ظاهر نمی‌شود.

مواردی که مدل‌های کوچک‌تر برنده مطلق هستند

در موارد زیر، Haiku 4.5 انتخاب مناسبی است:

  • کارهای مکانیکی زیر-نماینده (subagent). یک زیر-نماینده که وظیفه تغییر نام فایل‌ها یا جمع‌آوری خروجی جستجو را دارد، نیازی به استدلال پیشرفته ندارد. این یک الگوی استاندارد پس از آن است که شما یک عامل هوش مصنوعی با Claude بسازید و به آن ابزارهای کمکی اختصاص دهید.
  • دسته‌بندی لاگ‌ها (Log triage). تصمیم‌گیری در مورد اینکه آیا یک خط از لاگ، نویز است یا ارزش توجه انسان را دارد، یک قضاوت محدود با حالت‌های شکست مشخص است.
  • طبقه‌بندی بر اساس یک مجموعه برچسب ثابت. خروجی کوتاه است و دقت آن بر روی یک نمونه قابل اندازه‌گیری است.
  • فراخوانی‌های تولیدی با حجم بالا. در 100,000 اجرا در روز، اختلاف هزینه بر حسب توکن دیگر یک خطای گرد کردن نیست. این ساختار معمول در گردش‌کارهای هوش مصنوعی متصل به n8n است.
  • هر موردی که سرعت پاسخ‌دهی برای کاربر اهمیت دارد. Haiku 4.5 سریع‌ترین مدل در این مجموعه است.

یک محدودیت مخصوص به Haiku وجود دارد. حداقل اندازه پرامپت قابل کش (cacheable) برای آن 4,096 توکن است، در حالی که این مقدار برای Opus 4.8 و Sonnet 5 برابر با 1,024 توکن است؛ در مقادیر کمتر از این حد، "تمام درخواست‌ها برای تعداد توکن‌های کمتر از این مقدار، بدون کش شدن پردازش می‌شوند و هیچ خطایی برگردانده نمی‌شود". یک بلوک دستورالعمل 1,500 توکنی که در Sonnet 5 بدون خطا کش می‌شود، در Haiku 4.5 بدون اطلاع کش نمی‌شود. نشانه‌ی آن، صفر بودن هر دو مقدار cache_creation_input_tokens و cache_read_input_tokens است، که در کنار سایر روش‌های از دست رفتن کش، بر کاهش هزینه‌های یک عامل همیشه-فعال تأثیر می‌گذارد.

اهرم‌هایی که پاسخ را تغییر می‌دهند

هر یک از این موارد، تأثیر بیشتری نسبت به نام مدل بر هزینه نهایی دارند.

Effort. پارامتر output_config.effort میزان پردازش مدل پیش از پاسخ‌دهی را کنترل می‌کند. سطوح مختلف شامل low، medium، high، xhigh و max هستند و مقدار پیش‌فرض high است: "تنظیم effort روی high دقیقاً همان رفتار حذف کامل پارامتر effort را ایجاد می‌کند." این پارامتر به جای قرارگیری در سطح اصلی درخواست، درون output_config قرار می‌گیرد:

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    messages=messages,
)

پارامتر Effort بر تمام توکن‌های پاسخ اثر می‌گذارد: "این پارامتر می‌تواند بر تمام هزینه‌های توکن از جمله tool calls اثر بگذارد. برای مثال، مقدار effort کمتر به این معناست که Claude tool calls کمتری انجام می‌دهد." این موضوع در یک حلقه agentic اثر مضاعف دارد. این پارامتر محدودیت توکن نیست: "Effort یک سیگنال رفتاری است، نه یک سقف سخت‌گیرانه برای توکن." شرکت Anthropic ضریب هزینه برای هر سطح منتشر نمی‌کند و توصیه می‌کند مورد استفاده خود را تست کنید؛ بنابراین مقایسه اجرای Sonnet 5 در سطح high با Opus 4.8 در سطح low، مقایسه‌ای واقعی است که می‌توانید امروز انجام دهید. مدل Haiku 4.5 در لیست مدل‌های پشتیبانی‌کننده از effort وجود ندارد.

Prompt caching. هزینه خواندن از cache برابر با 0.1x نرخ پایه ورودی است و عدد تعیین‌کننده برای انتخاب مدل، بر اساس عملکرد آن در سطوح مختلف است. یک cache hit در مدل Opus 4.8 هزینه 0.50$ / MTok دارد، در حالی که ورودی بدون cache در Haiku 4.5 هزینه 1$ / MTok دارد؛ بنابراین یک prefix کش‌شده در Opus ارزان‌تر از یک prompt بدون کش در Haiku است. برای هر حجم کاری که یک prefix بزرگ و ثابت را مجدداً ارسال می‌کند، مدیریت صحیح session از انتخاب مدل مهم‌تر است.

Batches. اگر پاسخ فوری مورد نیاز نباشد، Message Batches API همان مدل‌ها را با "50% تخفیف روی هر دو توکن ورودی و خروجی" اجرا می‌کند. این قابلیت هزینه هر ردیف از مقایسه زیر را نصف می‌کند و در تمامی سطوح کار می‌کند: یک job در مدل Opus 4.8 به صورت batched، از یک job همزمان در Sonnet 5 با قیمت استاندارد (از 1 September 2026) ارزان‌تر است؛ در واقع در اینجا با همان هزینه، تأخیر (latency) را فدای توانایی مدل می‌کنید.

مقایسه هزینه یک مورد کاری

بار کاری: دسته‌بندی 100,000 ایمیل پشتیبانی، هر ایمیل در یک فراخوانی، شامل 2,000 توکن ورودی و 300 توکن خروجی در هر فراخوانی. این معادل 200 MTok ورودی و 30 MTok خروجی است.

  • Haiku 4.5: 200 x $1 = $200 ورودی، 30 x $5 = $150 خروجی. مجموع $350.
  • Sonnet 5، نرخ اولیه: 200 x $2 = $400 ورودی، 30 x $10 = $300 خروجی. مجموع $700.
  • Sonnet 5، از 1 September 2026: 200 x $3 = $600 ورودی، 30 x $15 = $450 خروجی. مجموع $1,050.
  • Opus 4.8: 200 x $5 = $1,000 ورودی، 30 x $25 = $750 خروجی. مجموع $1,750.

برای محاسبه مجدد با قیمت‌های فردا، چهار عدد را تغییر دهید. تعدیلات زیر، نتیجه را نسبت به نام مدل تغییر می‌دهند:

  • Batching هزینه هر خط را نصف می‌کند: $175، $350، $525 و $875. در یک اجرای دسته‌ای شبانه، هیچ پردازشی منتظر نمی‌ماند، بنابراین دلیلی برای نادیده گرفتن آن وجود ندارد.
  • Caching پیشوند مشترک. فرض کنید 1,200 توکن از 2,000 توکن ورودی، هر بار یک بلوک دستورالعمل ثابت هستند. در Sonnet 5 با نرخ اولیه، هزینه این توکن‌ها به عنوان cache hits برابر با $0.20 / MTok است، به جای $2 / MTok؛ بنابراین 120 MTok به جای $240، برابر با $24 هزینه دارد. با اضافه کردن 80 MTok ورودی جدید با قیمت $2 (یعنی $160) و $300 خروجی، هزینه Sonnet 5 به جای $700، حدود $484 می‌شود. این ترفند در Haiku 4.5 تاثیری ندارد، زیرا 1,200 توکن کمتر از حداقل 4,096 توکن آن است.
  • Retries. فرض کنید پاسخ Haiku را در 8% از ایمیل‌ها رد کنید و آن‌ها را مجدداً با Opus 4.8 اجرا کنید. مقدار 0.08 x $1,750 = $140 را به $350 اضافه کنید که حاصل $490 می‌شود. به جای استفاده از عدد من، نرخ رد پاسخ خود را اندازه‌گیری کنید.
  • Tool definitions، اگر کار از آن‌ها استفاده کند. سیستم پرامپت تولید شده توسط آن‌ها در Opus 4.8 با تنظیم tool_choice روی auto برابر با 290 توکن، در Sonnet 5 برابر با 354 توکن و در Haiku 4.5 برابر با 496 توکن است. ارزان‌ترین مدل، بیشترین سربار ثابت را دارد.

Haiku با مسیر ارتقا (escalation path) با هزینه $490 و Sonnet 5 با قابلیت cache با هزینه $484، هزینه‌ای یکسان دارند و یکی از آن‌ها کار را در یک مرحله انجام می‌دهد. مدل، تمام مسئله نبود.

آیا تغییر مدل در میان یک session باعث صرفه‌جویی در هزینه می‌شود؟

کمتر از آنچه قیمت‌های اعلام شده نشان می‌دهند، زیرا صرفه‌جویی بر اساس هر token محاسبه می‌شود و آنچه در خطر قرار می‌گیرد، یک prefix کش شده کامل است.

Anthropic موارد بی‌اعتباری کش را مستند کرده است. Prefixها به ترتیب tools، سپس system و سپس messages ساخته می‌شوند و «تغییرات در هر سطح، آن سطح و تمام سطوح بعدی را بی‌اعتبر می‌کند.» دو تنظیم درخواست نیز در این لیست هستند: «تنظیمات thinking و سطح resolved effort در خودِ prompt رندر می‌شوند، بنابراین تغییر هر یک از آن‌ها باعث شروع یک prefix کش جدید می‌شود.» در مستندات در مورد effort توضیح داده شده است: «به جای تغییر در یک conversation که به cache hits متکی است، effort را در بین workloadهای مختلف تغییر دهید.»

مدل در آن لیست مستند شده نیست، بنابراین هیچ فرضی در این مورد نداشته باشید. در اولین درخواست پس از تغییر، cache_read_input_tokens را بخوانید و اجازه دهید عدد پاسخگو باشد. در یک prefix مدل Opus با 150,000 token، هزینه یک cache read حدود $0.08 و هزینه یک write جدید حدود $0.94 است، که بیشتر از اختلاف قیمت چندین turn در حالت per-token است که به دنبال آن بودید.

بنابراین این موارد را بین وظایف (tasks) تغییر دهید، نه در داخل یک وظیفه. در Claude Code این به معنای ابتدا /clear است، زمانی که کش در حال حذف شدن است، و سپس /model یا /effort.

روش تست پاسخ بر اساس حجم کاری خودتان

اندازه‌گیری حجم یک prompt بر اساس تعداد توکن‌های یک مدل دیگر انجام نشود. استفاده از endpoint محاسبه توکن رایگان است و از tokenizer همان مدلی که نام می‌برید استفاده می‌کند؛ بنابراین مدلی را انتخاب کنید که قصد فراخوانی آن را دارید. مدل‌های Opus 4.7 و نسخه‌های جدیدتر، و همچنین Fable 5 و Sonnet 5 از tokenizer جدیدتری استفاده می‌کنند که «برای یک متن یکسان، تقریباً 30% توکن بیشتری تولید می‌کند»؛ بنابراین بودجه‌ای که بر اساس یک مدل قدیمی محاسبه شده باشد، در مدل جدید با نرخ ثابتِ هر توکن، کمتر از مقدار واقعی خواهد بود.

سپس خروجی را بررسی کنید. مقدار input_tokens فقط باقی‌مانده‌ی بدون cache است، بنابراین حجم واقعی prompt برابر است با این فیلد به علاوه cache_creation_input_tokens به علاوه cache_read_input_tokens. اولین اپلیکیشن Claude API روی یک VPS کوچک‌ترین و دقیق‌ترین مکان برای انجام این اندازه‌گیری است، و انتخاب طرح Claude متناسب با میزان استفاده شما تصمیمی مجزا در مورد پرداخت هزینه به ازای هر توکن است.

FAQ

کدام مدل Claude برای کدنویسی بهتر است؟

طبق مستندات، Claude Opus 4.8 نقطه شروع برای کدنویسی پیچیده و مبتنی بر عامل (agentic) است. قیمت آن تا July 2026، مبلغ 5 دلار به ازای هر میلیون توکن ورودی و 25 دلار به ازای هر میلیون توکن خروجی است. Claude Sonnet 5 بهترین ترکیب از سرعت و هوشمندی محسوب می‌شود و تا 31 August 2026، با قیمت 2 دلار / 10 دلار، کمتر از نصف هزینه مدل دیگر است. یک وظیفه یکسان را روی هر دو مدل اجرا کنید، تنظیمات thinking را ثابت نگه دارید و مجموع هزینه توکن‌ها را از response.usage مقایسه کنید.

آیا Claude Haiku 4.5 برای جایگزینی Sonnet 5 به اندازه کافی ارزان هست؟

از نظر هزینه هر توکن، بله: در قیمت‌گذاری اولیه، 1 دلار / 5 دلار در مقابل 2 دلار / 10 دلار برای Sonnet 5 است، یا از 1 September 2026، قیمت 3 دلار / 15 دلار خواهد بود. اما محدودیت‌ها تعیین‌کننده هستند. Haiku 4.5 به جای 1M، دارای پنجره بافت (context window) 200K توکن است، حداکثر خروجی 64K در Messages API همگرا دارد، تاریخ قطع دانش معتبر آن February 2025 است، فاقد پشتیبانی output_config.effort است، و دارای حداقل پرامپت قابل کش شدن (cacheable) 4,096 توکن است که باعث غیرفعال شدن بی‌صدای کش در پرامپت‌های سیستمی کوتاه می‌شود.

آیا تغییر به یک مدل ارزان‌تر Claude در میان یک نشست (session) باعث صرفه‌جویی در هزینه می‌شود؟

کمتر از آنچه به نظر می‌رسد. Anthropic موارد ابطال کش (cache invalidators) را شامل تغییر در پیشوند tools، system یا messages، تغییر در تنظیمات thinking و تغییر در output_config.effort می‌داند. تأثیر تغییر مدل بر کش موجود مستند نشده است، بنابراین آن را ناشناخته در نظر بگیرید و در اولین درخواست بعدی، cache_read_input_tokenscache_read_input_tokens را بخوانید. این موضوع اهمیت دارد: در یک پیشوند 150,000 توکنی Opus 4.8، هزینه خواندن از کش حدود 0.08 دلار و هزینه نوشتن مجدد حدود 0.94 دلار است، که از صرفه‌جویی در چندین مرحله (turn) بر اساس هزینه هر توکن بیشتر است. در Claude Code، پس از /clear، بین وظایف مختلف سوئیچ کنید، زیرا در آن حالت کش بدون توجه به نوع مدل دور ریخته می‌شود.

پارامتر output_config.effort چه تأثیری بر صورت‌حساب من دارد؟

این پارامتر نحوه مصرف توکن مدل در متن، فراخوانی ابزار (tool calls) و تفکر (thinking) را تغییر می‌دهد. میزان effort کمتر، باعث فراخوانی ابزار کمتر می‌شود که در حلقه‌های عامل‌محور (agentic loops) اثر lũچوی دارد، زیرا نتیجه هر ابزار در مراحل بعدی دوباره ارسال می‌شود. سطوح آن عبارتند از low، medium، high، xhigh و max که high مقدار پیش‌فرض است. Anthropic ضریب هزینه برای هر سطح منتشر نمی‌کند و effort را به جای بودجه توکن، یک سیگنال رفتاری می‌نامد؛ بنابراین آن را بر اساس وظیفه خود بسنجید.

Claude Batches API چقدر باعث صرفه‌جویی می‌شود؟

50% در هر دو توکن ورودی و خروجی، در ازای تحویل غیرهمگرا (asynchronous). تا July 2026، این یعنی Opus 4.8 با قیمت 2.50 دلار ورودی / 12.50 دلار خروجی، Sonnet 5 با قیمت 1 دلار / 5 دلار در قیمت‌گذاری اولیه، و Haiku 4.5 با قیمت 0.50 دلار / 2.50 دلار. مقایسه‌ای که ارزش توجه دارد در میان سطوح مختلف است: یک کار Opus 4.8 در حالت batch، از یک کار Sonnet 5 همگرا با نرخ استاندارد از 1 September 2026 ارزان‌تر است؛ بنابراین batching اجازه می‌دهد با همان هزینه، از مدل قدرتمندتری استفاده کنید.