SSD Nodes Learn Hosting plans →
راهنماها Matt Connorتوسط Matt Connor · به‌روزرسانی شده 2026-08-27

راهنمای انتخاب مدل Claude و مقایسه هزینه‌ها (2026)

کدام مدل Claude برای پروژه شما به صرفه‌تر است؟ بررسی نرخ‌های API در جولای 2026 برای Opus 4.8، Sonnet 5 و Haiku 4.5 به همراه تحلیل هزینه اجرای 100,000 درخواست متوالی.

از کدام مدل Claude استفاده کنم؟

پاسخ کوتاه به این پرسش که از کدام مدل Claude استفاده کنید این است: با Claude Opus 4.8 شروع کنید و تنها زمانی آن را تغییر دهید که دلیل مشخصی برای این کار داشته باشید. راهنمایی Anthropic نیز همین است: «اگر مطمئن نیستید از کدام مدل استفاده کنید، برای کدنویسی‌های پیچیدهٔ عاملی (agentic) و کارهای سازمانی، با Claude Opus 4.8 شروع کنید.» زمانی که وظیفه به‌خوبی تعریف شده است و آن را چندین بار در روز اجرا می‌کنید، به سراغ Claude Sonnet 5 بروید. برای کارهای مکانیکی و با حجم بالا که از قبل می‌دانید پاسخ صحیح چگونه است، به سراغ Claude Haiku 4.5 بروید. Claude Fable 5 برای عامل‌های طولانی‌مدت، بالاتر از همهٔ این‌ها قرار می‌گیرد.

این انتخاب هزینه‌ای به همراه دارد. این‌ها نرخ‌های API (رابط برنامه‌نویسی اپلیکیشن) Claude تا تاریخ 23 July 2026، به ازای هر میلیون توکن هستند که در مستندات با عنوان MTok نوشته می‌شود.

  • Claude Fable 5 (claude-fable-5): 10 دلار به ازای هر MTok ورودی، 50 دلار به ازای هر MTok خروجی. کانتکست 1M.
  • Claude Opus 4.8 (claude-opus-4-8): 5 دلار ورودی، 25 دلار خروجی. کانتکست 1M.
  • Claude Opus 4.7 (claude-opus-4-7): 5 دلار ورودی، 25 دلار خروجی. کانتکست 1M.
  • Claude Sonnet 5 (claude-sonnet-5): 2 دلار ورودی، 10 دلار خروجی با قیمت‌گذاری مقدماتی تا 31 August 2026. نرخ استاندارد 3 دلار ورودی و 15 دلار خروجی از تاریخ 1 September 2026 اعمال می‌شود. کانتکست 1M.
  • Claude Haiku 4.5 (claude-haiku-4-5): 1 دلار ورودی، 5 دلار خروجی. کانتکست 200K.

این شناسه‌ها همان‌طور که نوشته شده‌اند کامل هستند. هیچ چیزی به آن‌ها اضافه نمی‌شود.

در مدل‌هایی که ظرفیت 1M توکن دارند، خود اندازه درخواست هیچ هزینه اضافی ایجاد نمی‌کند: «هزینه یک درخواست 900k توکنی با همان نرخ هر توکن یک درخواست 9k توکنی محاسبه می‌شود.» این نرخ‌ها فقط به API محدود نیستند، زیرا Claude Enterprise میزان استفاده را بر اساس نرخ‌های API محاسبه می‌کند و این هزینه را علاوه بر قیمت هر seat دریافت می‌کند؛ بنابراین، تمام محاسبات زیر برای تیمی با طرح مبتنی بر seat نیز یکسان است. اشتراک با نرخ ثابت معیار محاسبه را تغییر می‌دهد، اما این تصمیم را تغییر نمی‌دهد، زیرا هر دو tier از Claude Max همان مدل‌ها را ارائه می‌کنند و فقط در میزان استفاده قابل‌دسترسی تفاوت دارند. در سطح پایین‌تر همین مسیر، هزینه ماهانه $20 در Claude Pro یک سهمیه استفاده است، نه نرخ مبتنی بر هر توکن؛ بنابراین چیزی که در آنجا شما را متوقف می‌کند، reset شدن محدودیت است، نه دریافت صورت‌حساب. اگر در حال حاضر در این وضعیت هستید، مشخص‌کردن این‌که منتظر کدام window هستید باید پیش از هرگونه محاسبه زیر انجام شود، زیرا راه‌حل، استفاده از مدل کوچک‌تر، context کوچک‌تر یا انتقال به API است، نه انتخاب نرخ ارزان‌تر. اگر هنوز پرداختی را شروع نکرده‌اید، ارزش‌داشتن Pro در برابر $20 از ابتدا بر اساس این تعیین می‌شود که محدودیت رایگان چند وقت یک‌بار مانع شما می‌شود، نه بر اساس هیچ‌یک از نرخ‌های بالا.

کاربرد واقعی هر مدل

شرکت Anthropic برای هر مدل در این مجموعه یک توصیف تک‌خطی ارائه می‌دهد که راهنمای بهتری نسبت به هر جدول رده‌بندی است.

  • مدل Claude Fable 5: «هوش نسل بعدی برای عامل‌های (agents) طولانی‌مدت.» این مدل در میان چهار مدل، کندترین نرخ تأخیر (latency) را دارد.
  • مدل Claude Opus 4.8: «برای کدنویسی پیچیدهٔ عامل‌محور و کارهای سازمانی.» دارای تأخیر متوسط.
  • مدل Claude Sonnet 5: «بهترین ترکیب از سرعت و هوش.» سریع.
  • مدل Claude Haiku 4.5: «سریع‌ترین مدل با هوشی نزدیک به مرزهای دانش.»

مدل Fable 5 تنها موردی است که در این مقایسه، هیچ‌گاه برای آن هزینه‌ای بر اساس حجم کاری تعیین نشده است و با نرخی دو برابر Opus 4.8، پرسش دربارهٔ اینکه کدام کارها بازدهی 10 دلار ورودی و 50 دلار خروجی دارند، نیازمند پاسخ اختصاصی خود است.

مدل Haiku 4.5 همچنین محدودیت‌هایی دارد که پیش از قیمت، تعیین‌کنندهٔ مناسب بودن آن برای یک کار است. پنجرهٔ متنی (context window) آن 200K توکن است، نه 1M؛ بنابراین یک مخزن کد بزرگ یا رونوشت طولانی از یک عامل در آن جای نمی‌گیرد. حداکثر خروجی آن در Messages API همزمان، 64K توکن است، در حالی که این مقدار برای سایر مدل‌ها 128K است. همچنین تاریخ قطع دانش (knowledge cutoff) قابل‌اتکای آن فوریه 2025 است، در حالی که سه مدل دیگر در ژانویه 2026 قرار دارند.

انتخاب مدل در یک بار کاری واقعی چه هزینه‌ای برای من دارد؟

هر مدل در این مجموعه، قیمت خروجی را پنج برابر نرخ ورودی خود تعیین کرده است. قیمت Opus 4.8 برابر با 5 دلار برای ورودی و 25 دلار برای خروجی است. قیمت Haiku 4.5 برابر با 1 دلار برای ورودی و 5 دلار برای خروجی است. این نسبت در تمام مدل‌ها برقرار است، بنابراین مدل انتخابی شما بیشترین تأثیر را بر کارهایی دارد که خروجی زیادی تولید می‌کنند.

کارهای عاملی (Agentic) از این نوع هستند، زیرا توکن‌های تفکر (thinking tokens) به عنوان توکن‌های خروجی محاسبه می‌شوند و حتی زمانی که متن هرگز به دست شما نمی‌رسد، در max_tokens لحاظ می‌شوند. در Fable 5، Opus 4.8، Opus 4.7 و Sonnet 5، خلاصه استدلال به‌طور پیش‌فرض حذف می‌شود، بنابراین فیلد thinking خالی برمی‌گردد. هزینه تغییری نمی‌کند: "در هر صورت، این بلوک به یک شکل محاسبه شده و در گفتگوهای چندمرحله‌ای به همان شکل بازگردانده می‌شود." مقاله چه چیزی واقعاً صورت‌حساب توکن Claude را پر می‌کند این سازوکار محاسبه را به‌طور کامل کالبدشکافی می‌کند.

اینکه آیا فرآیند تفکر اصلاً اجرا می‌شود یا خیر، بین مدل‌هایی که مقایسه می‌کنید متفاوت است؛ اگر به این نکته توجه نکنید، تست هزینه شما بی‌نتیجه خواهد بود. در Sonnet 5 و Fable 5، قابلیت تفکر از قبل فعال است و نیازی به پیکربندی ندارد. در Opus 4.8 و Opus 4.7، این قابلیت تا زمانی که thinking: {type: "adaptive"} را در درخواست تنظیم نکنید، غیرفعال است. پیش از آنکه بخواهید اعداد را تحلیل کنید، پیکربندی هر دو طرف را یکسان‌سازی کنید.

چرا ارزان‌ترین مدل می‌تواند گران‌ترین باشد

یک وظیفهٔ برنامه‌نویسی مستقل را در نظر بگیرید. درخواست شامل 60,000 توکن متن زمینه (context) است و مدل 8,000 توکن خروجی شامل مراحل تفکر تولید می‌کند. بدون استفاده از قابلیت caching، محاسبات به این صورت است.

در مدل Opus 4.8: هزینه 0.06 میلیون توکن ورودی با نرخ $5 برابر با $0.30 و 0.008 میلیون توکن خروجی با نرخ $25 برابر با $0.20 است. این تلاش در مجموع $0.50 هزینه دارد. در مدل Haiku 4.5 همان تلاش $0.06 برای ورودی و $0.04 برای خروجی، یعنی در مجموع $0.10 هزینه خواهد داشت.

مدل Haiku در هر تلاش پنج برابر ارزان‌تر است؛ این تفاوت در نگاه اول فضای مانور زیادی ایجاد می‌کند، اما باید دید که یک تلاش ناموفق چه پیامدهایی دارد. شما پاسخ اشتباه را می‌خوانید که باعث اتلاف وقتتان می‌شود. سپس آن را به عنوان بخشی از متن زمینه در تلاش مجدد ارسال می‌کنید، بنابراین هر تلاش نسبت به قبلی بزرگ‌تر می‌شود. و زمانی که تلاش سوم همچنان با خطا مواجه شود، در نهایت مجبور به ارتقای مدل می‌شوید: $0.30 هزینه Haiku به علاوه $0.50 هزینه Opus برابر با $0.80 می‌شود، یعنی 60 درصد گران‌تر از اجرای یک‌بارهٔ Opus.

بنابراین، پرسش تعیین‌کننده این است که با چه هزینه‌ای می‌توانید پاسخ را بررسی کنید. زمانی که تشخیص پاسخ اشتباه در یک ثانیه ممکن باشد، مدل کوچک‌تر یک انتخاب اقتصادی است. اما زمانی که تشخیص خطا مستلزم بررسی دقیق یک diff باشد، مدل کوچک‌تر هزینه‌ای از زمان شما می‌گیرد که هرگز در صورت‌حساب ظاهر نمی‌شود.

مواردی که مدل کوچک‌تر برتری مطلق دارد

مدل Haiku 4.5 در موارد زیر انتخاب مناسبی است:

  • کارهای مکانیکی توسط subagent. یک subagent که فایل‌ها را تغییر نام می‌دهد یا خروجی جستجو را جمع‌آوری می‌کند، نیازی به استدلال در سطح frontier ندارد. این الگوی استاندارد پس از آن است که شما یک AI agent با Claude می‌سازید و به آن دستیار می‌دهید.
  • تریاژ لاگ. تصمیم‌گیری درباره اینکه یک خط لاگ نویز است یا ارزش توجه انسان را دارد، یک قضاوت محدود با حالت شکست مشخص است.
  • دسته‌بندی بر اساس مجموعه‌ای از برچسب‌های ثابت. خروجی کوتاه است و دقت آن روی یک نمونه قابل اندازه‌گیری است.
  • فراخوانی‌های تولیدی با حجم بالا. در 100,000 اجرا در روز، اختلاف هزینه به ازای هر توکن دیگر یک خطای گرد کردن ساده نیست. این شکل معمولِ گردش‌کارهای AI متصل به n8n است.
  • هر موردی که سرعت پاسخ‌دهی برای کاربر اهمیت دارد. Haiku 4.5 سریع‌ترین مدل در این سری شناخته می‌شود.

یک محدودیت مشخصاً مربوط به Haiku است. حداقل مقدار prompt قابل کش (cacheable) در آن 4,096 توکن است، در حالی که این مقدار برای Opus 4.8 و Sonnet 5 برابر با 1,024 توکن است. زیر این حداقل، «هر درخواستی برای کش کردن تعداد توکنی کمتر از این مقدار، بدون کش شدن پردازش می‌شود و هیچ خطایی نیز بازگردانده نمی‌شود». یک بلوک دستورالعمل 1,500 توکنی که روی Sonnet 5 کش می‌شود، روی Haiku 4.5 بدون هیچ پیامی کش نمی‌شود. نشانه آن این است که cache_creation_input_tokens و cache_read_input_tokens هر دو روی صفر باقی می‌مانند، که مبحث کاهش هزینه‌های یک agent همیشه روشن به همراه سایر روش‌های از دست دادن کش، به آن می‌پردازد.

اهرم‌هایی که پاسخ را تغییر می‌دهند

هر یک از این موارد، تأثیر بیشتری نسبت به نام مدل بر خروجی نهایی دارد.

تلاش (Effort). پارامتر output_config.effort کنترل می‌کند که مدل پیش از ارائه پاسخ، چه مقدار پردازش انجام دهد. سطوح موجود عبارتند از low، medium، high، xhigh و max، که high مقدار پیش‌فرض است: «تنظیم effort روی high دقیقاً همان رفتاری را ایجاد می‌کند که حذف کامل پارامتر effort دارد.» این پارامتر به جای قرارگیری در سطح بالای درخواست، درون output_config جای می‌گیرد:

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    messages=messages,
)

پارامتر Effort بر تمام توکن‌های پاسخ تأثیر می‌گذارد: «این پارامتر می‌تواند بر کل مصرف توکن، از جمله فراخوانی ابزارها (tool calls) اثر بگذارد. برای مثال، تلاش کمتر به این معناست که Claude تعداد کمتری ابزار فراخوانی می‌کند.» این موضوع در یک حلقه عاملی (agentic loop) تشدید می‌شود. این پارامتر یک سقف توکن نیست: «Effort یک سیگنال رفتاری است، نه یک بودجه توکن سخت‌گیرانه.» شرکت Anthropic هیچ ضریب هزینه‌ای برای هر سطح منتشر نکرده و توصیه می‌کند مورد استفاده خود را آزمایش کنید؛ بنابراین اجرای Sonnet 5 در سطح high در مقایسه با اجرای Opus 4.8 در سطح low، یک مقایسه واقعی است که می‌توانید همین امروز بعدازظهر انجام دهید. مدل Haiku 4.5 در لیست مدل‌هایی که از Effort پشتیبانی می‌کنند، وجود ندارد.

کش کردن پرامپت (Prompt caching). خواندن از کش، 0.1 برابر نرخ ورودی پایه هزینه دارد و عددی که انتخاب مدل را تعیین می‌کند، عملکرد آن در سطوح مختلف است. هزینه یک Cache hit برای Opus 4.8 برابر با $0.50 در هر میلیون توکن (MTok) است، در حالی که هزینه ورودی بدون کش برای Haiku 4.5 برابر با $1 در هر میلیون توکن است؛ بنابراین یک پیشوند Opus که به‌خوبی کش شده باشد، به ازای هر توکن ورودی ارزان‌تر از یک پرامپت سرد در Haiku است. در هر حجم کاری که نیاز به ارسال مجدد یک پیشوند بزرگ و ثابت دارد، رعایت بهداشت نشست (Session hygiene) بر انتخاب مدل ارجحیت دارد.

دسته‌ها (Batches). اگر نیازی به دریافت فوری پاسخ نباشد، API مربوط به Message Batches همان مدل‌ها را با «50 درصد تخفیف برای توکن‌های ورودی و خروجی» اجرا می‌کند. این کار هزینه هر ردیف در مقایسه زیر را نصف می‌کند و در تمام سطوح مدل‌ها کارایی دارد: یک پردازش دسته‌ای (batched) با Opus 4.8، از تاریخ 1 سپتامبر 2026 با قیمت استاندارد، ارزان‌تر از یک پردازش همگام (synchronous) با Sonnet 5 تمام می‌شود؛ در واقع شما با همان هزینه، تأخیر را فدای توانمندی بیشتر می‌کنید.

مقایسه هزینه یک حجم کاری

حجم کاری: دسته‌بندی 100,000 ایمیل پشتیبانی، هر کدام یک فراخوانی، 2,000 توکن ورودی و 300 توکن خروجی برای هر فراخوانی. این یعنی 200 MTok ورودی و 30 MTok خروجی.

  • Haiku 4.5: 200 x $1 = $200 ورودی، 30 x $5 = $150 خروجی. مجموع $350.
  • Sonnet 5، نرخ مقدماتی: 200 x $2 = $400 ورودی، 30 x $10 = $300 خروجی. مجموع $700.
  • Sonnet 5، از 1 سپتامبر 2026: 200 x $3 = $600 ورودی، 30 x $15 = $450 خروجی. مجموع $1,050.
  • Opus 4.8: 200 x $5 = $1,000 ورودی، 30 x $25 = $750 خروجی. مجموع $1,750.

چهار عدد را تغییر دهید تا محاسبات با قیمت‌های فردا دوباره انجام شود. تعدیل‌های زیر نتیجه را بیش از نام مدل تغییر می‌دهند:

  • دسته‌بندی (Batching) هر سطر را نصف می‌کند: $175، $350، $525 و $875. هیچ‌چیز در اجرای دسته‌بندی شبانه منتظر نمی‌ماند، بنابراین دلیلی برای صرف‌نظر از آن وجود ندارد.
  • کش کردن پیشوند مشترک. فرض کنید 1,200 توکن از 2,000 توکن ورودی، در هر بار همان بلوک دستورالعمل ثابت باشد. در Sonnet 5 با نرخ مقدماتی، این توکن‌ها به عنوان cache hit با قیمت $0.20 به ازای هر MTok محاسبه می‌شوند، نه $2 به ازای هر MTok؛ بنابراین 120 MTok هزینه $24 خواهد داشت به جای $240. با افزودن 80 MTok ورودی جدید با قیمت $2 که می‌شود $160، به علاوه $300 خروجی، هزینه Sonnet 5 به جای $700 به حدود $484 می‌رسد. همین ترفند روی Haiku 4.5 هیچ اثری ندارد، زیرا 1,200 توکن کمتر از حداقل 4,096 توکن مورد نیاز آن است.
  • تلاش مجدد (Retries). فرض کنید پاسخ Haiku را در 8 درصد ایمیل‌ها رد می‌کنید و آن‌ها را دوباره با Opus 4.8 اجرا می‌کنید. 0.08 x $1,750 = $140 را به $350 اضافه کنید که می‌شود $490. نرخ رد کردن خود را اندازه بگیرید و از نرخ من استفاده نکنید.
  • تعریف ابزارها، اگر کار از آن‌ها استفاده می‌کند. پرامپت سیستمی که آن‌ها تولید می‌کنند در Opus 4.8 با تنظیم tool_choice روی auto برابر با 290 توکن، در Sonnet 5 برابر با 354 توکن و در Haiku 4.5 برابر با 496 توکن است. ارزان‌ترین مدل، بیشترین سربار ثابت را تحمیل می‌کند.

هزینه Haiku با مسیر ارجاع (escalation path) برابر با $490 و هزینه Sonnet 5 با استفاده از کش برابر با $484 تقریباً یکسان است و یکی از آن‌ها کار را در یک مرحله انجام می‌دهد. مدل هرگز تمام مسئله نبوده است.

آیا تغییر مدل در میان یک نشست باعث صرفه‌جویی در هزینه می‌شود؟

کمتر از آنچه قیمت‌های اسمی نشان می‌دهند، زیرا صرفه‌جویی به‌ازای هر توکن محاسبه می‌شود و آنچه به خطر می‌اندازید، کل یک پیشوند (prefix) کش‌شده است.

شرکت Anthropic مواردی که باعث ابطال کش می‌شوند را مستند کرده است. پیشوندها به ترتیب tools، سپس system و در نهایت messages ساخته می‌شوند و «تغییر در هر سطح، آن سطح و تمام سطوح بعدی را باطل می‌کند.» دو تنظیمات درخواست نیز در آن لیست قرار دارند: «پیکربندی تفکر (thinking configuration) و سطح حل‌شده effort در خود پرامپت رندر می‌شوند، بنابراین تغییر هر یک از آن‌ها باعث شروع یک پیشوند کش جدید می‌شود.» در مورد effort، مستندات فراتر می‌روند: «به‌جای تغییر در حین مکالمه‌ای که به hit شدن کش متکی است، effort را در بارهای کاری مختلف تغییر دهید.»

مدل در آن لیست مستندشده قرار ندارد، بنابراین در مورد آن هیچ فرضی نکنید. در اولین درخواست پس از تغییر مدل، cache_read_input_tokens را بخوانید و اجازه دهید اعداد پاسخ را به شما بدهند. برای یک پیشوند Opus 4.8 با حجم 150,000 توکن، خواندن از کش حدود 0.08 دلار و نوشتن تازه حدود 0.94 دلار هزینه دارد که از اختلاف قیمت چند نوبتِ توکن‌هایی که به‌دنبال صرفه‌جویی در آن‌ها بودید، بیشتر است.

بنابراین این تغییرات را بین وظایف انجام دهید، نه در حین انجام یک وظیفه. در Claude Code، این یعنی ابتدا /clear را انجام دهید، زمانی که کش به‌هرحال در حال دور ریخته شدن است، و سپس /model یا /effort را تغییر دهید. هر دوی این‌ها در CLI تایپ می‌شوند، بنابراین اگر با Linux کار می‌کنید، نصب نسخه‌ای که ارزشش را دارد نسخه ترمینال است، زیرا آنچه Anthropic به‌صورت بومی برای Linux ارائه می‌دهد یک CLI پایدار را با یک اپلیکیشن دسکتاپ که هنوز در مرحله بتا است، جفت می‌کند. اینکه آیا این جابه‌جایی اصلاً در صورت‌حساب ظاهر می‌شود یا خیر، به نحوه پرداخت شما برای آن نشست بستگی دارد، زیرا Claude Code یا با طرح ماهانه ثابت اجرا می‌شود یا با اعتبار API به‌ازای هر توکن و تنها در حالت دوم است که تغییر مدل با دلار قیمت‌گذاری می‌شود.

نحوه تست پاسخ روی workload اختصاصی خود

اندازه پرامپت را با شمارشی که از مدل دیگری گرفته شده است، تعیین نکنید. استفاده از endpoint شمارش توکن رایگان است و با tokenizer همان مدلی که نام می‌برید محاسبه می‌کند؛ بنابراین مدلی را که قصد فراخوانی آن را دارید، مشخص کنید. آن endpoint یکی از معدود بخش‌های پلتفرم است که هرگز هزینه‌ای ندارد و بررسی سایر مواردی که می‌توانید بدون پرداخت هزینه اجرا کنید پیش از صرف اعتبار واقعی برای مقایسه، ارزشمند است. مدل‌های Opus 4.7 و نسخه‌های بعد از آن، Fable 5 و Sonnet 5 از tokenizer جدیدتری استفاده می‌کنند که «برای متن یکسان، تقریباً 30% توکن بیشتری تولید می‌کند»؛ بنابراین بودجه‌ای که بر اساس یک مدل قدیمی اندازه‌گیری شده است، در مدل جدید با نرخ ثابت به ازای هر توکن، کمتر از مقدار واقعی به نظر می‌رسد.

سپس خروجی بازگشتی را مطالعه کنید. input_tokens فقط شامل باقی‌مانده غیرکش‌شده (uncached) است، بنابراین اندازه واقعی پرامپت برابر است با آن فیلد به علاوه cache_creation_input_tokens و cache_read_input_tokens. اولین اپلیکیشن Claude API روی یک VPS کوچک‌ترین محیط صادقانه‌ای است که می‌توانید این اندازه‌گیری را در آن انجام دهید، و اینکه کدام طرح Claude با میزان استفاده شما متناسب است تصمیمی جداگانه درباره این است که آیا اصلاً باید به ازای هر توکن هزینه پرداخت کنید یا خیر. اگر مشخص شد که مسئله انتخاب نوع اشتراک است و نه لزوماً داشتن یا نداشتن آن، مقایسه قیمت سطوح Claude در کنار ChatGPT هزینه‌های انجام کار برنامه‌نویسی مشابه در سرویس‌دهنده دیگر را پوشش می‌دهد. اگر این اندازه‌گیری باعث می‌شود کار خود را برای همیشه به API منتقل کنید، کاهش سطح اشتراک یا لغو کامل آن همچنان دوره زمانی‌ای را که قبلاً برای آن پرداخت کرده‌اید برای شما باقی می‌گذارد، بنابراین پس از مشخص شدن اعداد و ارقام، هیچ جریمه‌ای برای تصمیم‌گیری وجود ندارد.

FAQ

کدام مدل Claude برای کدنویسی مناسب‌تر است؟

مدل Claude Opus 4.8 نقطه شروع مستند برای کدنویسی عاملی (agentic) پیچیده است که تا ژوئیه 2026، هزینه آن 5 دلار به ازای هر میلیون توکن ورودی و 25 دلار به ازای هر میلیون توکن خروجی است. مدل Claude Sonnet 5 به عنوان بهترین ترکیب از سرعت و هوشمندی شناخته می‌شود و با قیمت 2 دلار / 10 دلار تا 31 اوت 2026، کمتر از نصف مدل قبلی هزینه دارد. یک تسک مشابه را روی هر دو اجرا کنید، پیکربندی thinking را ثابت نگه دارید و مجموع هزینه توکن‌ها را از response.usage مقایسه کنید.

آیا Claude Haiku 4.5 به اندازه کافی ارزان است که جایگزین Sonnet 5 شود؟

از نظر هزینه هر توکن، بله: 1 دلار / 5 دلار در مقایسه با 2 دلار / 10 دلار برای Sonnet 5 در قیمت‌گذاری اولیه، یا 3 دلار / 15 دلار از 1 سپتامبر 2026. محدودیت‌ها تعیین‌کننده هستند. مدل Haiku 4.5 دارای پنجره کانتکست 200K توکنی به جای 1M، حداکثر خروجی 64K در Messages API همگام، تاریخ دانش قابل اتکای فوریه 2025، عدم پشتیبانی از output_config.effort و حداقل پرامپت قابل کش (cacheable) 4,096 توکنی است که در پرامپت‌های کوتاه سیستم، کش را به‌طور خودکار غیرفعال می‌کند.

آیا تغییر مدل Claude به مدلی ارزان‌تر در میانه نشست (session)، باعث صرفه‌جویی در هزینه می‌شود؟

کمتر از آنچه به نظر می‌رسد. Anthropic ابطال‌کننده‌های کش را به عنوان تغییر در پیشوند tools، system یا messages، تغییر در پیکربندی thinking و تغییر در output_config.effort مستند کرده است. تأثیر تغییر مدل بر کش موجود مستند نشده است، بنابراین آن را ناشناخته فرض کنید و cache_read_input_tokens را در اولین درخواست پس از آن بررسی کنید. ارزش این موضوع مشخص است: روی یک پیشوند 150,000 توکنی Opus 4.8، خواندن از کش حدود 0.08 دلار و نوشتن تازه حدود 0.94 دلار هزینه دارد که از صرفه‌جویی چند دورِ هزینه هر توکن بیشتر است. تغییر مدل را بین تسک‌ها و پس از /clear در Claude Code انجام دهید، یعنی زمانی که کش در هر صورت دور ریخته می‌شود.

پارامتر output_config.effort چه تأثیری بر صورت‌حساب من دارد؟

این پارامتر تعداد توکن‌هایی را که مدل در متن، فراخوانی ابزارها و thinking صرف می‌کند، تغییر می‌دهد. تلاش (effort) کمتر باعث فراخوانی‌های ابزار کمتری می‌شود که در حلقه‌های عاملی (agentic loops) تأثیر مضاعف دارد، زیرا هر نتیجه ابزار در دورهای بعدی مجدداً ارسال می‌شود. سطوح شامل low، medium، high، xhigh و max است و high به عنوان پیش‌فرض در نظر گرفته می‌شود. Anthropic هیچ ضریب هزینه‌ای برای هر سطح منتشر نکرده و effort را یک سیگنال رفتاری می‌داند تا بودجه توکن؛ بنابراین آن را روی تسک خودتان اندازه‌گیری کنید.

استفاده از Claude Batches API چقدر صرفه‌جویی دارد؟

50 درصد در توکن‌های ورودی و خروجی، در ازای تحویل غیرهمگام (asynchronous). تا ژوئیه 2026، این موضوع هزینه Opus 4.8 را به 2.50 دلار ورودی / 12.50 دلار خروجی، Sonnet 5 را به 1 دلار / 5 دلار در قیمت‌گذاری اولیه و Haiku 4.5 را به 0.50 دلار / 2.50 دلار می‌رساند. مقایسه‌ای که ارزش توجه دارد در سطوح مختلف است: یک تسک دسته‌ای (batched) با Opus 4.8 کمتر از یک تسک همگام با Sonnet 5 با نرخ استاندارد از 1 سپتامبر 2026 هزینه دارد؛ بنابراین batching به شما امکان می‌دهد با همان هزینه، از مدل قدرتمندتری استفاده کنید.