SSD Nodes Learn
নির্দেশিকা Matt Connorদ্বারা Matt Connor · আপডেট করা হয়েছে 2026-07-24

কোন Claude model ব্যবহার করবেন? খরচ ও গাইড

Opus 4.8, Sonnet 5 নাকি Haiku 4.5? ২০২৬ সালের জুলাই মাসের রেট এবং ১০০,০০০টি কাজের জন্য সঠিক মডেলটি বেছে নেওয়ার বিস্তারিত খরচ তুলনা এখানে দেখুন।

আমি কোন Claude model ব্যবহার করব?

কোন Claude model ব্যবহার করবেন তার সংক্ষিপ্ত উত্তর হলো: Claude Opus 4.8 দিয়ে শুরু করুন, এবং শুধুমাত্র কোনো সুনির্দিষ্ট কারণ থাকলে অন্য মডেলে চলে যান। Anthropic-এর নির্দেশিকাও একই। "আপনি যদি নিশ্চিত না হন কোন model ব্যবহার করবেন, তবে জটিল agentic coding এবং enterprise কাজের জন্য Claude Opus 4.8 দিয়ে শুরু করুন।" যখন কাজটি সুনির্দিষ্টভাবে জানা থাকে এবং আপনি দিনে অনেকবার এটি চালান, তখন Claude Sonnet 5 ব্যবহার করুন। যান্ত্রিক এবং উচ্চ-পরিমাণ সম্পন্ন কাজের জন্য, যেখানে সঠিক উত্তর কেমন হবে তা আপনি আগে থেকেই জানেন, তখন Claude Haiku 4.5 ব্যবহার করুন। দীর্ঘমেয়াদী agents-এর জন্য Claude Fable 5 সবার উপরে অবস্থান করে।

এই পছন্দের একটি মূল্য রয়েছে। 23 July 2026 তারিখ পর্যন্ত Claude API (application programming interface)-এর রেটগুলো প্রতি মিলিয়ন token অনুযায়ী নিচে দেওয়া হলো, যা docs-এ MTok হিসেবে লেখা হয়েছে।

  • Claude Fable 5 (claude-fable-5): $10 / MTok in, $50 / MTok out. 1M context.
  • Claude Opus 4.8 (claude-opus-4-8): $5 in, $25 out. 1M context.
  • Claude Opus 4.7 (claude-opus-4-7): $5 in, $25 out. 1M context.
  • Claude Sonnet 5 (claude-sonnet-5): 31 August 2026 পর্যন্ত introductory pricing অনুযায়ী $2 in, $10 out। 1 September 2026 থেকে standard $3 in, $15 out কার্যকর হবে। 1M context.
  • Claude Haiku 4.5 (claude-haiku-4-5): $1 in, $5 out. 200K context.

এই identifier গুলো যেভাবে লেখা হয়েছে সেভাবেই থাকবে। এগুলোর সাথে কিছু যোগ করা হবে না।

1M-token মডেলগুলোর ক্ষেত্রে আকারের জন্য কোনো অতিরিক্ত চার্জ নেই: "একটি 900k-token request-এর জন্য প্রতি-token রেট একই হবে যা একটি 9k-token request-এর জন্য প্রযোজ্য।"

প্রতিটি মডেল আসলে কী কাজের জন্য

Anthropic প্রতিটি মডেলের জন্য এক লাইনের বর্ণনা দেয়, যা যেকোনো লিডারবোর্ডের চেয়ে বেশি কার্যকর নির্দেশিকা হিসেবে কাজ করে।

  • Claude Fable 5: "দীর্ঘমেয়াদী agents-এর জন্য পরবর্তী প্রজন্মের বুদ্ধিমত্তা।" ল্যাটেন্সির (latency) দিক থেকে এই চারটি মডেলের মধ্যে এটি সবচেয়ে ধীরগতির।
  • Claude Opus 4.8: "জটিল agentic coding এবং এন্টারপ্রাইজ কাজের জন্য।" মাঝারি ল্যাটেন্সি।
  • Claude Sonnet 5: "গতি এবং বুদ্ধিমত্তার সেরা সমন্বয়।" দ্রুতগতির।
  • Claude Haiku 4.5: "frontier intelligence সমতুল্য সবচেয়ে দ্রুতগতির মডেল।"

Haiku 4.5-এর কিছু সীমাবদ্ধতা রয়েছে যা দামের আগে কাজের উপযুক্ততা নির্ধারণ করে দেয়। এর context window 1M tokens-এর পরিবর্তে 200K tokens, তাই বড় কোনো repository বা দীর্ঘ agent transcript এতে ধরবে না। synchronous Messages API-তে এর maximum output হলো 64K tokens, যেখানে অন্যান্য মডেলের জন্য এটি 128K tokens। এছাড়া এর reliable knowledge cutoff হলো February 2025, যেখানে বাকি তিনটি মডেলের cutoff হলো January 2026।

একটি বাস্তব কাজের ক্ষেত্রে এই পছন্দটি আমার কত খরচ করতে পারে?

এই সিরিজের প্রতিটি মডেলের আউটপুট রেট ইনপুট রেটের পাঁচ গুণ। Opus 4.8 এর ক্ষেত্রে ইনপুট $5 এবং আউটপুট $25। Haiku 4.5 এর ক্ষেত্রে ইনপুট $1 এবং আউটপুট $5। এই অনুপাতটি পুরো রেঞ্জ জুড়ে বজায় থাকে, তাই আপনি যে মডেলটি বেছে নেবেন তা মূলত সেই কাজের ক্ষেত্রে গুরুত্বপূর্ণ যেখানে প্রচুর আউটপুট তৈরি হয়।

Agentic কাজ এই ধরণের কাজের অন্তর্ভুক্ত, কারণ thinking tokens গুলো আউটপুট টোকেন হিসেবে বিল করা হয় এবং max_tokens এর অন্তর্ভুক্ত হয়, এমনকি যদি টেক্সটটি আপনার কাছে না পৌঁছায় তবুও। Fable 5, Opus 4.8, Opus 4.7 এবং Sonnet 5 মডেলে reasoning summary ডিফল্টভাবে বাদ দেওয়া হয়, তাই thinking ফিল্ডটি খালি থাকে। বিলিং পদ্ধতি অপরিবর্তিত থাকে: "যেকোনোভাবেই ব্লকের বিল একই হবে এবং multi-turn conversations এ একইভাবে ফেরত পাঠানো হবে।" Claude টোকেন বিল আসলে কী দিয়ে পূর্ণ হয় এটি বিস্তারিতভাবে ব্যাখ্যা করে।

আপনি যে মডেলগুলোর তুলনা করছেন তাদের মধ্যে thinking চালু থাকবে কি না তা ভিন্ন হতে পারে, যা খেয়াল না করলে আপনার cost test ভুল ফলাফল দিতে পারে। Sonnet 5 এবং Fable 5 মডেলে thinking ডিফল্টভাবে চালু থাকে এবং কোনো configuration প্রয়োজন হয় না। Opus 4.8 এবং Opus 4.7 মডেলে এটি বন্ধ থাকে যতক্ষণ না আপনি request এ thinking: {type: "adaptive"} সেট করছেন। সংখ্যাগুলো বিশ্লেষণ করার আগে উভয় পাশে configuration একই আছে কিনা তা নিশ্চিত করুন।

কেন সবচেয়ে সস্তা মডেলটি সবচেয়ে ব্যয়বহুল হতে পারে

একটি স্বতন্ত্র coding task বিবেচনা করুন। রিকোয়েস্টটিতে 60,000 tokens এর context রয়েছে এবং মডেলটি thinking সহ 8,000 tokens এর output প্রদান করে। কোনো caching নেই, তাই হিসাবটি সরাসরি দেখা যাচ্ছে।

Opus 4.8-এ: $5 রেটে 0.06 MTok input মানে $0.30, এবং $25 রেটে 0.008 MTok output মানে $0.20। একটি প্রচেষ্টার খরচ $0.50। Haiku 4.5-এ একই প্রচেষ্টার খরচ $0.06 যোগ $0.04, অর্থাৎ $0.10।

প্রতি প্রচেষ্টায় Haiku পাঁচ গুণ সস্তা, যা অনেক সাশ্রয়ী মনে হয়। কিন্তু একটি ব্যর্থ প্রচেষ্টার ফলাফল কী তা দেখলে ধারণা বদলে যাবে। আপনি ভুল উত্তরটি পড়বেন, যা আপনার সময় নষ্ট করবে। রিট্রাই করার সময় আপনি সেটি context হিসেবে পুনরায় পাঠাবেন, ফলে প্রতিটি প্রচেষ্টা আগেরটির চেয়ে বড় হবে। এবং যখন তৃতীয় প্রচেষ্টায়ও উত্তর ভুল আসে, তখন আপনি Opus ব্যবহার করবেন: $0.30 এর Haiku যোগ $0.50 এর Opus মানে মোট $0.80, যা একবার Opus চালানোর চেয়ে 60% বেশি।

তাই সিদ্ধান্ত নেওয়ার প্রশ্নটি হলো আপনি কত কম খরচে উত্তরটি যাচাই করতে পারেন। যখন ভুল উত্তরটি এক সেকেন্ডের মধ্যে বোঝা যায়, তখন ছোট মডেলটি সাশ্রয়ী। কিন্তু ভুলটি শনাক্ত করতে যদি একটি diff মনোযোগ দিয়ে পড়তে হয়, তবে ছোট মডেলটি আপনার এমন সময় নষ্ট করে যা ইনভয়েসে দেখা যায় না।

যেখানে ছোট মডেল সরাসরি জয়ী হয়

এই ক্ষেত্রগুলোতে Haiku 4.5 সঠিক সমাধান:

  • Mechanical subagent work. ফাইল রিনেম করা বা সার্চ আউটপুট সংগ্রহ করার মতো subagent-এর জন্য উন্নত reasoning-এর প্রয়োজন নেই। আপনি যখন build an AI agent with Claude করবেন এবং তাকে helpers প্রদান করবেন, তখন এটি একটি standard pattern হিসেবে কাজ করে।
  • Log triage. কোনো লাইনটি noise নাকি মানুষের মনোযোগের প্রয়োজন তা নির্ধারণ করা একটি narrow judgement, যেখানে ভুল হওয়ার সম্ভাবনা স্পষ্ট।
  • Classification against a fixed label set. আউটপুট ছোট হয় এবং একটি sample-এর মাধ্যমে নির্ভুলতা পরিমাপ করা যায়।
  • High-volume production calls. প্রতিদিন 100,000 রান সম্পন্ন করার ক্ষেত্রে per-token খরচের পার্থক্য বড় হয়ে দাঁড়ায়। AI workflows wired into n8n সাধারণত এই ধরনের হয়।
  • যেখানে ব্যবহারকারীর জন্য রেসপন্স স্পিড গুরুত্বপূর্ণ। Haiku 4.5 এই lineup-এর দ্রুততম মডেল হিসেবে বিবেচিত।

Haiku-এর একটি নির্দিষ্ট সীমাবদ্ধতা রয়েছে। Opus 4.8 এবং Sonnet 5-এ minimum cacheable prompt হলো 1,024 tokens, কিন্তু Haiku-তে এটি 4,096 tokens। এই সীমার নিচে কোনো রিকোয়েস্ট ক্যাশ করা হবে না এবং কোনো error প্রদান করা হবে না। Sonnet 5-এ একটি 1,500-token instruction block নিঃশব্দে ক্যাশ হলেও Haiku 4.5-এ তা ক্যাশ হবে না। এর লক্ষণ হলো cache_creation_input_tokens এবং cache_read_input_tokens উভয়ই শূন্য থাকবে, যা keeping an always-on agent's costs down এবং ক্যাশ হারানোর অন্যান্য কারণগুলোর মতো একটি বিষয়।

উত্তর পরিবর্তনকারী নিয়ন্ত্রকসমূহ

এগুলোর প্রতিটি মডেলের নামের তুলনায় বিলের পরিমাণকে আরও বেশি প্রভাবিত করে।

Effort. output_config.effort নিয়ন্ত্রণ করে মডেলটি উত্তর দেওয়ার আগে কতটা কাজ করবে। এর লেভেলগুলো হলো low, medium, high, xhigh এবং max; ডিফল্ট হলো high: "effort কে high এ সেট করলে effort প্যারামিটারটি সম্পূর্ণ বাদ দেওয়ার মতো একই আচরণ পাওয়া যায়।" এটি রিকোয়েস্টের টপ লেভেলে না থেকে output_config এর ভেতরে থাকে:

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    messages=messages,
)

Effort রেসপন্সের প্রতিটি টোকেনকে প্রভাবিত করে: "এটি টুল কলসহ সমস্ত টোকেন খরচের ওপর প্রভাব ফেলতে পারে। উদাহরণস্বরূপ, কম effort মানে Claude কম সংখ্যক টুল কল করবে।" এটি একটি এজেন্টিক লুপের ক্ষেত্রে প্রভাব বাড়িয়ে দেয়। এটি কোনো টোকেন সীমা নয়: "Effort হলো একটি আচরণগত সংকেত, কোনো কঠোর টোকেন বাজেট নয়।" Anthropic প্রতিটি লেভেলের জন্য কোনো কস্ট মাল্টিপ্লায়ার প্রকাশ করে না এবং আপনাকে আপনার নিজস্ব ইউজ কেস পরীক্ষা করতে বলে। তাই আজ বিকেলে আপনি high লেভেলে একটি Sonnet 5 রান এবং low লেভেলে একটি Opus 4.8 রান করে প্রকৃত তুলনা করতে পারেন। Effort সাপোর্ট করে এমন মডেলের তালিকায় Haiku 4.5 নেই।

Prompt caching. একটি cache read এর খরচ বেস ইনপুট রেটের 0.1x। মডেল নির্বাচনের ক্ষেত্রে বিভিন্ন টায়ারের মধ্যে এই সংখ্যাটি কাজ করে। Opus 4.8 এ একটি cache hit এর খরচ $0.50 / MTok, এবং Haiku 4.5 এ uncached ইনপুট এর খরচ $1 / MTok। তাই একটি ভালোভাবে ক্যাশ করা Opus প্রিফিক্স, একটি কোল্ড Haiku প্রম্পটের তুলনায় প্রতি ইনপুট টোকেনে সস্তা। যে কোনো ওয়ার্কলোড যা একটি বড় এবং স্থিতিশীল প্রিফিক্স বারবার পাঠায়, সেখানে মডেল নির্বাচনের চেয়ে সেশন হাইজিন বেশি কার্যকর।

Batches. যদি উত্তরের জন্য কোনো তাৎক্ষণিক অপেক্ষা না থাকে, তবে Message Batches API একই মডেল "ইনপুট এবং আউটপুট উভয় টোকেনের ওপর 50% ডিসকাউন্টে" চালায়। এটি নিচের প্রতিটি তুলনার মান অর্ধেক করে দেয় এবং এটি সব টায়ারে কাজ করে: 1 September 2026 থেকে স্ট্যান্ডার্ড প্রাইসে একটি ব্যাচ করা Opus 4.8 জব, একটি সিনক্রোনাস Sonnet 5 জবের চেয়ে কম খরচে সম্পন্ন হয়; এখানে একই খরচে ল্যাটেন্সির পরিবর্তে সক্ষমতা বাড়ানো হয়।

একটি কাজের জন্য খরচের তুলনা

Workload: ১০০,০০০টি support email classify করা। প্রতিটি কলের জন্য ১টি call, প্রতি কলে ২,০০০ input tokens এবং ৩০০ output tokens। অর্থাৎ মোট ২০০ MTok input এবং ৩০ MTok output।

  • Haiku 4.5: ২০০ x $১ = $২০০ in, ৩০ x $৫ = $১৫০ out. Total $৩৫০।
  • Sonnet 5, introductory rate: ২০০ x $২ = $৪০০ in, ৩০ x $১০ = $৩০০ out. Total $৭০০।
  • Sonnet 5, 1 September 2026 থেকে: ২০০ x $৩ = $৬০০ in, ৩০ x $১৫ = $৪৫০ out. Total $১,০৫০।
  • Opus 4.8: ২০০ x $৫ = $১,০০০ in, ৩০ x $২৫ = $৭৫০ out. Total $১,৭৫০।

আগামীকালের দাম অনুযায়ী পুনরায় গণনা করতে চারটি সংখ্যা পরিবর্তন করুন। নিচের সমন্বয়গুলো মডেলের নামের তুলনায় ফলাফলকে বেশি প্রভাবিত করে:

  • Batching প্রতিটি লাইন অর্ধেক করে দেয়: $১৭৫, $৩৫০, $৫২৫ এবং $৮৭৫। nightly classification run-এ কোনো কাজ অপেক্ষা করে না, তাই এটি বাদ দেওয়ার প্রয়োজন নেই।
  • Shared prefix caching। ধরুন, ২,০০০টি input tokens-এর মধ্যে ১,২০০টি প্রতিবার একই instruction block। Sonnet 5-এর introductory rate-এ cache hits হিসেবে এগুলোর খরচ $২ / MTok এর পরিবর্তে $০.২০ / MTok। ফলে ১২০ MTok-এর খরচ $২৪০ এর পরিবর্তে মাত্র $২৪। এর সাথে $২ হিসেবে ৮০ MTok fresh input যোগ করুন, যা $১৬০; এবং $৩০০ output যোগ করুন। এতে Sonnet 5-এর খরচ $৭০০ এর পরিবর্তে প্রায় $৪৮৪ হয়। Haiku 4.5-এর ক্ষেত্রে এই পদ্ধতি কাজ করে না, কারণ ১,২০০ tokens এর সর্বনিম্ন সীমা ৪,০৯৬-token এর নিচে।
  • Retries। ধরুন, আপনি ৮% email-এর ক্ষেত্রে Haiku-এর উত্তর প্রত্যাখ্যান করছেন এবং সেগুলো Opus 4.8-এ পুনরায় চালাচ্ছেন। $৩৫০ এর সাথে (০.০৮ x $১,৭৫০) = $১৪০ যোগ করুন, যা হয় $৪৯০। আমার খরচের পরিবর্তে আপনার নিজস্ব rejection rate পরিমাপ করুন।
  • Tool definitions, যদি কাজে ব্যবহৃত হয়। Opus 4.8-এ tool_choice যদি auto হিসেবে সেট করা থাকে, তবে তাদের দ্বারা তৈরি system prompt হলো ২৯০ tokens; Sonnet 5-এ ৩৫৪ এবং Haiku 4.5-এ ৪৯৬ tokens। সবচেয়ে সস্তা মডেলটির fixed overhead সবচেয়ে বেশি।

$৪৯০ খরচের escalation path সহ Haiku এবং $৪৮৪ খরচের cached Sonnet 5-এর খরচ সমান, এবং এর মধ্যে একটি মডেল একটি single pass-এ কাজটি সম্পন্ন করতে পারে। মডেলটিই একমাত্র বিবেচ্য বিষয় নয়।

সেশন চলাকালীন মডেল পরিবর্তন করলে কি খরচ কমবে?

Sticker price বা নির্ধারিত মূল্যের তুলনায় এটি খুব কম ক্ষেত্রেই ঘটে, কারণ সাশ্রয় হয় প্রতি token এর ভিত্তিতে, কিন্তু এর ফলে একটি সম্পূর্ণ cached prefix হারানোর ঝুঁকি থাকে।

Anthropic নথিতে উল্লেখ করা হয়েছে কোন কোন কারণে cache invalid হয়ে যায়। Prefix গুলো tools, তারপর system, এবং তারপর messages ক্রম অনুসারে তৈরি করা হয়। "প্রতিটি লেভেলে পরিবর্তন হলে সেই লেভেল এবং তার পরবর্তী সকল লেভেল invalid হয়ে যায়।" এই তালিকায় আরও দুটি request setting রয়েছে: "Thinking configuration এবং resolved effort level সরাসরি prompt এর ভেতরে যুক্ত করা হয়, তাই এগুলোর যেকোনো একটি পরিবর্তন করলে নতুন cache prefix তৈরি হয়।" Effort এর ক্ষেত্রে ডকুমেন্টেশন আরও বিস্তারিত বলছে: "Cache hit এর ওপর নির্ভরশীল কোনো conversation এর ভেতরে নয়, বরং বিভিন্ন workload এর মধ্যে effort পরিবর্তন করুন।"

Model এই ডকুমেন্ট করা তালিকায় নেই, তাই কোনো বিষয়েই নিশ্চিত ধারণা করা উচিত নয়। মডেল পরিবর্তনের পর প্রথম request এর ক্ষেত্রে cache_read_input_tokens দেখুন এবং সংখ্যা দেখে সিদ্ধান্ত নিন। একটি 150,000-token Opus 4.8 prefix এর ক্ষেত্রে cache read করতে প্রায় $0.08 খরচ হয় এবং নতুন করে write করতে প্রায় $0.94 খরচ হয়; যা আপনার কাঙ্ক্ষিত per-token gap এর কয়েক turn এর চেয়েও বেশি।

তাই একটি কাজের ভেতরে নয়, বরং কাজ পরিবর্তনের সময় এই বিষয়গুলো পরিবর্তন করুন। Claude Code এর ক্ষেত্রে এর অর্থ হলো প্রথমে /clear করুন, যখন cache এমনিতেই বাদ দেওয়া হচ্ছে, তারপর /model অথবা /effort করুন।

আপনার নিজস্ব workload-এ উত্তরটি কীভাবে পরীক্ষা করবেন

অন্য কোনো model থেকে নেওয়া count দিয়ে prompt-এর size নির্ধারণ করবেন না। token-counting endpoint ব্যবহার করা বিনামূল্যে এবং আপনি যে model-টির নাম দেবেন, সেটি সেই model-এর tokenizer ব্যবহার করেই count করবে; তাই আপনি যে model-টি ব্যবহার করতে চান তার নামই প্রদান করুন। Opus 4.7 এবং পরবর্তী সংস্করণ, Fable 5 এবং Sonnet 5 নতুন tokenizer ব্যবহার করে যা "একই text-এর জন্য প্রায় 30% বেশি tokens তৈরি করে"। তাই পুরনো model-এ পরিমাপ করা budget নতুন model-এর ক্ষেত্রে কম দেখাবে, যদিও per-token rate একই থাকে।

এরপর প্রাপ্ত ফলাফলটি পড়ুন। input_tokens হলো শুধুমাত্র uncached remainder, তাই প্রকৃত prompt size হলো এই field-এর সাথে cache_creation_input_tokens এবং cache_read_input_tokens যোগ করলে যা পাওয়া যায়। A VPS-এ প্রথম Claude API app হলো এই measurement করার জন্য সবচেয়ে সহজ ও সঠিক মাধ্যম, এবং আপনার usage-এর জন্য কোন Claude plan উপযুক্ত তা হলো আপনি প্রতি token-এর জন্য পেমেন্ট করবেন কি না সেই বিষয়ে একটি আলাদা সিদ্ধান্ত।

FAQ

কোডিং করার জন্য কোন Claude মডেলটি সবচেয়ে ভালো?

জটিল agentic coding-এর জন্য Claude Opus 4.8 হলো নথিবদ্ধ শুরুর বিন্দু। ২০২৬ সালের জুলাই পর্যন্ত, এর ইনপুট টোকেন প্রতি $5 এবং আউটপুট টোকেন প্রতি $25 খরচ হয়। Claude Sonnet 5 গতি এবং বুদ্ধিমত্তার সেরা সমন্বয় হিসেবে পরিচিত। ২০২৬ সালের ৩১ আগস্ট পর্যন্ত এর খরচ $2 / $10, যা অর্ধেকেরও কম। একই টাস্ক উভয় মডেলে চালান, thinking configuration অপরিবর্তিত রাখুন, এবং response.usage থেকে মোট টোকেন খরচ তুলনা করুন।

Claude Haiku 4.5 কি Sonnet 5-এর বিকল্প হিসেবে যথেষ্ট সাশ্রয়ী?

প্রতি টোকেন হিসেবে এটি সহজেই সম্ভব: Sonnet 5-এর প্রারম্ভিক মূল্য $2 / $10 (অথবা ২০২৬ সালের ১ সেপ্টেম্বর থেকে $3 / $15) এর বিপরীতে Haiku 4.5 এর মূল্য $1 / $5। তবে সীমাবদ্ধতাগুলো বিবেচনা করতে হবে। Haiku 4.5-এ 1M এর পরিবর্তে 200K টোকেন context window আছে, synchronous Messages API-তে সর্বোচ্চ 64K আউটপুট পাওয়া যায়, এর নির্ভরযোগ্য জ্ঞান ২০২৫ সালের ফেব্রুয়ারি পর্যন্ত সীমাবদ্ধ, এতে কোনো output_config.effort সাপোর্ট নেই, এবং ৪,০৯৬-টোকেন সর্বনিম্ন cacheable prompt আছে যা ছোট system prompt-এর ক্ষেত্রে caching নিষ্ক্রিয় করে দেয়।

সেশনের মাঝখানে সাশ্রয়ী Claude মডেলে পরিবর্তন করলে কি টাকা সাশ্রয় হয়?

এটি যতটা মনে হয় ততটা সাশ্রয় হয় না। Anthropic অনুযায়ী, tools, system অথবা messages prefix পরিবর্তন, thinking configuration পরিবর্তন এবং output_config.effort পরিবর্তন হলো cache invalidators। একটি মডেল পরিবর্তন বিদ্যমান cache-এর ওপর কী প্রভাব ফেলে তা নথিবদ্ধ করা নেই, তাই এটিকে অজানা হিসেবে গণ্য করুন এবং পরবর্তী প্রথম রিকোয়েস্টের সময় cache_read_input_tokens পড়ুন। বিষয়টি জানা গুরুত্বপূর্ণ: একটি 150,000-টোকেন Opus 4.8 prefix-এর জন্য একটি cache read-এর খরচ প্রায় $0.08 এবং একটি নতুন write-এর খরচ প্রায় $0.94, যা প্রতি-টোকেন সাশ্রয়ের কয়েক ধাপের চেয়ে বেশি। Claude Code-এ /clear এর পরে, যখন cache এমনিতেই মুছে ফেলা হয়, তখন টাস্ক পরিবর্তন করুন।

output_config.effort আমার বিলের ওপর কী প্রভাব ফেলে?

এটি টেক্সট, tool calls এবং thinking-এর মাধ্যমে মডেল কত টোকেন খরচ করবে তা পরিবর্তন করে। কম effort দিলে tool calls কম হয়, যা agentic loops-এর ক্ষেত্রে প্রভাব ফেলে কারণ প্রতিটি tool result পরবর্তী ধাপগুলোতে পুনরায় পাঠানো হয়। এর লেভেলগুলো হলো low, medium, high, xhigh এবং max, যেখানে high হলো ডিফল্ট। Anthropic প্রতিটি লেভেলের জন্য কোনো cost multiplier প্রকাশ করে না; তারা effort-কে টোকেন বাজেটের পরিবর্তে একটি behavioural signal হিসেবে বিবেচনা করে, তাই আপনার নিজস্ব টাস্কের ওপর ভিত্তি করে এটি পরিমাপ করুন।

Claude Batches API কতটুকু সাশ্রয় করে?

Asynchronous ডেলিভারির বিনিময়ে এটি ইনপুট এবং আউটপুট উভয় টোকেনের ওপর ৫০% সাশ্রয় করে। ২০২৬ সালের জুলাই পর্যন্ত, এর ফলে Opus 4.8-এর খরচ হয় $2.50 ইন / $12.50 আউট, Sonnet 5-এর প্রারম্ভিক মূল্য $1 / $5, এবং Haiku 4.5-এর খরচ হয় $0.50 / $2.50। উল্লেখযোগ্য তুলনাটি বিভিন্ন tier-এর মধ্যে: ২০২৬ সালের ১ সেপ্টেম্বর থেকে একটি batched Opus 4.8 জব-এর খরচ স্ট্যান্ডার্ড রেটে একটি synchronous Sonnet 5 জব-এর চেয়ে কম হবে, তাই batching ব্যবহার করলে একই খরচে আরও শক্তিশালী মডেল পাওয়া যায়।