SSD Nodes Learn Hosting plans →
নির্দেশিকা Matt Connorদ্বারা Matt Connor · আপডেট করা হয়েছে 2026-08-27

কোন Claude model ব্যবহার করবেন? খরচের সম্পূর্ণ গাইড

Opus 4.8, Sonnet 5 নাকি Haiku 4.5? 23 July 2026-এর model-ভিত্তিক API rate, 100,000 jobs-এর খরচের উদাহরণ এবং bill বদলানো settings দেখুন।

কোন Claude model ব্যবহার করা উচিত?

কোন Claude model ব্যবহার করবেন, তার সংক্ষিপ্ত উত্তর হলো: Claude Opus 4.8 দিয়ে শুরু করুন। আপনি যে নির্দিষ্ট কারণে এটি পরিবর্তন করছেন, সেই কারণটি স্পষ্টভাবে বলতে না পারলে অন্য model-এ যাবেন না। Anthropic-এর নির্দেশনাও একই। “কোন model ব্যবহার করবেন তা নিশ্চিত না হলে, জটিল agentic coding এবং enterprise কাজের জন্য Claude Opus 4.8 দিয়ে শুরু করুন।” কাজটি ভালোভাবে নির্দিষ্ট করা থাকলে এবং দিনে অনেকবার চালালে Claude Sonnet 5-এ নামুন। যেসব যান্ত্রিক, উচ্চ-পরিমাণের কাজে সঠিক উত্তরের ধরন আগে থেকেই জানা থাকে, সেগুলোর জন্য Claude Haiku 4.5 বেছে নিন। দীর্ঘ সময় চলা agent-এর জন্য Claude Fable 5 সবগুলোর উপরে রয়েছে।

এই পছন্দের সঙ্গে খরচও যুক্ত। 23 July 2026 অনুযায়ী Claude API (application programming interface)-এর প্রতি million token-এর হার নিচে দেওয়া হলো। ডকুমেন্টে এগুলোকে MTok হিসেবে লেখা হয়।

  • Claude Fable 5 (claude-fable-5): input-এ $10 / MTok, output-এ $50 / MTok। 1M context।
  • Claude Opus 4.8 (claude-opus-4-8): input-এ $5, output-এ $25। 1M context।
  • Claude Opus 4.7 (claude-opus-4-7): input-এ $5, output-এ $25। 1M context।
  • Claude Sonnet 5 (claude-sonnet-5): 31 August 2026 পর্যন্ত introductory pricing-এ input-এ $2, output-এ $10। 1 September 2026 থেকে standard rate হিসেবে input-এ $3, output-এ $15 কার্যকর হবে। 1M context।
  • Claude Haiku 4.5 (claude-haiku-4-5): input-এ $1, output-এ $5। 200K context।

এই identifier-গুলো যেভাবে লেখা আছে, সেভাবেই সম্পূর্ণ। এগুলোর শেষে কিছু যোগ হয় না।

1M-token মডেলগুলোতে আকারের জন্য আলাদা কোনো surcharge নেই: "900k-token request-এর জন্য 9k-token request-এর মতোই প্রতি-token rate প্রযোজ্য।" এই rate শুধু API-তেই সীমাবদ্ধ নয়, কারণ seat price-এর অতিরিক্ত হিসেবে Claude Enterprise API rate অনুযায়ী usage মাপে। তাই নিচের সব হিসাব seat plan ব্যবহারকারী team-এর ক্ষেত্রেও একই। Flat-rate subscription meter পরিবর্তন করে, কিন্তু এই সিদ্ধান্ত পরিবর্তন করে না, কারণ Claude Max-এর উভয় tier-এ একই model থাকে এবং পার্থক্য শুধু ব্যবহারের পরিমাণে। একই ladder-এর নিচে, Claude Pro-এর প্রতি মাসে $20 খরচে per-token rate নয়, usage allowance পাওয়া যায়। তাই সেখানে আপনাকে থামায় bill নয়, limit reset। আপনি যদি এখন সেই অবস্থায় থাকেন, কোন window-এর জন্য অপেক্ষা করছেন তা নির্ধারণ করা নিচের হিসাবের আগে করতে হবে। কারণ সমাধান হলো ছোট model, ছোট context বা API-তে যাওয়া; সস্তা rate নয়। আর আপনি যদি এখনও অর্থপ্রদান শুরু না করে থাকেন, প্রথমেই Pro-এর জন্য $20 দেওয়া সার্থক কি না তা নির্ধারিত হয় free limit আপনাকে কত ঘন ঘন থামায় তার ভিত্তিতে, উপরের কোনো rate-এর ভিত্তিতে নয়।

প্রতিটি মডেল আসলে কোন কাজের জন্য

Anthropic প্রতিটি মডেলকে একটি বাক্যে বর্ণনা করে। যেকোনো leaderboard-এর চেয়ে এই বর্ণনাগুলো মডেল বাছাইয়ে বেশি সহায়ক।

  • Claude Fable 5: "দীর্ঘ সময় চলা agent-এর জন্য পরবর্তী প্রজন্মের বুদ্ধিমত্তা।" Latency-এর দিক থেকে চারটির মধ্যে এটিই সবচেয়ে ধীর।
  • Claude Opus 4.8: "জটিল agentic coding এবং enterprise কাজের জন্য।" Latency মাঝারি।
  • Claude Sonnet 5: "গতি ও বুদ্ধিমত্তার সেরা সমন্বয়।" দ্রুত।
  • Claude Haiku 4.5: "প্রায় frontier-স্তরের বুদ্ধিমত্তাসহ দ্রুততম মডেল।"

Fable 5 হলো চারটির একমাত্র মডেল, যেটির জন্য এই তুলনায় কোনো workload-এর মূল্য হিসাব করা হয়নি। Opus 4.8-এর দ্বিগুণ rate হওয়ায় কোন কাজ $10 খরচ করে $50 আয় ফিরিয়ে দেয়—এই প্রশ্নের আলাদা উত্তর প্রয়োজন।

Haiku 4.5-এর কিছু সীমাবদ্ধতাও আছে, যা মূল্য বিবেচনার আগেই নির্ধারণ করে দেয় কোন কাজের জন্য এটি উপযুক্ত। এর context window 1M-এর পরিবর্তে 200K tokens, তাই বড় repository বা দীর্ঘ agent transcript এতে সম্পূর্ণভাবে fit করবে না। Synchronous Messages API-তে এর maximum output অন্যগুলোর 128K-এর বিপরীতে 64K tokens। এটির নির্ভরযোগ্য knowledge cutoff February 2025, যেখানে অন্য তিনটির cutoff January 2026।

বাস্তব workload-এ এই পছন্দের খরচ কত?

লাইনআপের প্রতিটি model তার input rate-এর 5 গুণ হারে output-এর মূল্য নির্ধারণ করে। Opus 4.8-এর input-এর দাম $5 এবং output-এর দাম $25। Haiku 4.5-এর input-এর দাম $1 এবং output-এর দাম $5। এই অনুপাত পুরো range-জুড়েই একই থাকে। তাই যে কাজ বেশি output তৈরি করে, সেখানে আপনার বেছে নেওয়া model-এর প্রভাব সবচেয়ে বেশি।

Agentic কাজ এই ধরনের কাজ। কারণ thinking token-কে output token হিসেবে বিল করা হয় এবং লেখা আপনার কাছে না পৌঁছালেও তা max_tokens-এর হিসাবে ধরা হয়। Fable 5, Opus 4.8, Opus 4.7 এবং Sonnet 5-এ reasoning summary ডিফল্টভাবে বাদ থাকে। তাই thinking field খালি ফেরে। Billing অপরিবর্তিত থাকে: "উভয় ক্ষেত্রেই block-এর জন্য একই billing হয় এবং multi-turn conversation-এ একইভাবে ফেরত পাঠানো হয়।" Claude token bill-এ আসলে কী কী যোগ হয় এই meter-এর প্রতিটি অংশ বিস্তারিতভাবে ব্যাখ্যা করে।

আপনি যে model-গুলোর তুলনা করছেন, সেগুলোর মধ্যে thinking আদৌ চালু হয় কি না, তা ভিন্ন। এই বিষয়টি উপেক্ষা করলে cost test-এর ফল অর্থহীন হবে। Sonnet 5 এবং Fable 5-এ thinking আগে থেকেই চালু থাকে এবং কোনো configuration প্রয়োজন হয় না। Opus 4.8 এবং Opus 4.7-এ request-এ thinking: {type: "adaptive"} সেট না করা পর্যন্ত এটি বন্ধ থাকে। সংখ্যাগুলো বিশ্লেষণ করার আগে দুই পাশের configuration একই করুন।

সবচেয়ে সস্তা model কীভাবে সবচেয়ে ব্যয়বহুল হতে পারে

একটি স্বয়ংসম্পূর্ণ coding task বিবেচনা করুন। অনুরোধে 60,000 tokens-এর context থাকে, এবং thinking-সহ model 8,000 tokens-এর output তৈরি করে। কোনো caching নেই, তাই হিসাবটি সরাসরি দেখা যায়।

Opus 4.8-এ 0.06 MTok input-এর খরচ $5 হারে $0.30, আর 0.008 MTok output-এর খরচ $25 হারে $0.20। একবারের চেষ্টা করতে খরচ হয় $0.50। Haiku 4.5-এ একই চেষ্টার খরচ $0.06 plus $0.04, অর্থাৎ $0.10।

প্রতি চেষ্টায় Haiku পাঁচ গুণ সস্তা। ব্যর্থ একটি চেষ্টা কী প্রভাব ফেলে তা বিবেচনা না করা পর্যন্ত এটি বড় সাশ্রয় বলে মনে হয়। আপনি ভুল উত্তরটি পড়েন, যার জন্য আপনার সময় খরচ হয়। Retry-এর সময় সেটিকে context হিসেবে আবার পাঠান, তাই প্রতিটি attempt আগেরটির চেয়ে বড় হয়। তৃতীয় attempt-ও ব্যর্থ হলে আপনি যেকোনো ক্ষেত্রে বড় model-এ যান: $0.30 Haiku-এর সঙ্গে $0.50 Opus যোগ করলে মোট $0.80 হয়, যা একবার Opus চালানোর চেয়ে 60% বেশি।

তাই সিদ্ধান্ত নির্ভর করে আপনি কত কম খরচে উত্তরটি যাচাই করতে পারেন তার ওপর। ভুল উত্তর এক সেকেন্ডেই বোঝা গেলে ছোট model সাশ্রয়ী। কিন্তু তা বুঝতে diff মনোযোগ দিয়ে পড়তে হলে ছোট model এমন সময় খরচ করায়, যা invoice-এ দেখা যায় না। সেই সময়ের একটি আর্থিক মূল্য নির্ধারণ করা Claude Code plan নিজের খরচ তুলে দেয় কি না তা হিসাব করার একই arithmetic। আর হিসাবের মধ্যে আপনার নিজের hourly rate যোগ করলে সস্তা model-কে প্রায়ই আর সস্তা মনে হয় না।

যেখানে ছোট মডেল স্পষ্টভাবে বেশি কার্যকর

এই পরিস্থিতিগুলোতে Haiku 4.5 সঠিক পছন্দ:

  • যান্ত্রিক subagent কাজ। কোনো subagent শুধু ফাইলের নাম পরিবর্তন বা search output সংগ্রহ করলে frontier reasoning প্রয়োজন হয় না। Claude দিয়ে একটি AI agent তৈরি করে তাকে helper দিলে এটিই সাধারণ প্যাটার্ন।
  • Log triage। কোনো line অপ্রয়োজনীয় কি না, নাকি মানুষের মনোযোগ প্রয়োজন, তা নির্ধারণ করা সীমিত পরিসরের একটি বিচার। এর ব্যর্থতার ধরনও স্পষ্ট।
  • নির্দিষ্ট label set অনুযায়ী classification। Output সংক্ষিপ্ত এবং sample-এর ওপর accuracy পরিমাপ করা যায়।
  • উচ্চ-পরিমাণের production call। দিনে 100,000 run হলে প্রতি token-এর খরচের পার্থক্য আর rounding error থাকে না। n8n-এ সংযুক্ত AI workflow সাধারণত এই ধরনের হয়।
  • যেখানে response speed ব্যবহারকারীর জন্য গুরুত্বপূর্ণ। Haiku 4.5-কে lineup-এর দ্রুততম model হিসেবে রেট করা হয়েছে।

Haiku-এর ক্ষেত্রে একটি নির্দিষ্ট সীমা আছে। এর minimum cacheable prompt হলো 4,096 token, যেখানে Opus 4.8 এবং Sonnet 5-এ তা 1,024। এই minimum-এর নিচে “এই সংখ্যার চেয়ে কম token cache করার সব request caching ছাড়াই process করা হবে, এবং কোনো error ফেরত দেওয়া হবে না”। Sonnet 5-এ যে 1,500-token instruction block cache হয়, Haiku 4.5-এ সেটি নীরবে cache হয় না। এর লক্ষণ হলো cache_creation_input_tokens এবং cache_read_input_tokens দুটিই zero অবস্থায় থাকা। সবসময় চালু থাকা agent-এর খরচ কম রাখা-সংক্রান্ত অংশে cache হারানোর অন্যান্য উপায়ের পাশাপাশি এই বিষয়টিও ব্যাখ্যা করা হয়েছে।

উত্তর পরিবর্তন করে এমন নিয়ামক

এই প্রতিটি পরিবর্তন model name-এর চেয়ে bill-এ বেশি প্রভাব ফেলে।

Effort। output_config.effort উত্তর দেওয়ার আগে model কতটা কাজ করবে তা নিয়ন্ত্রণ করে। স্তরগুলো হলো low, medium, high, xhigh এবং max, আর high হলো default: "effort-কে high-এ সেট করলে effort parameter সম্পূর্ণ বাদ দেওয়ার মতো একই আচরণ পাওয়া যায়।" এটি request-এর top level-এ না থেকে output_config-এর ভেতরে থাকে:

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    messages=messages,
)

Effort response-এর প্রতিটি token-এ প্রভাব ফেলে: "Tool call-সহ মোট token ব্যবহারেও এটি প্রভাব ফেলতে পারে। উদাহরণস্বরূপ, কম effort হলে Claude কম tool call করবে।" Agentic loop-এ এই প্রভাব আরও বাড়ে। এটি token cap নয়: "Effort একটি behavioral signal, কঠোর token budget নয়।" Anthropic প্রতিটি level-এর জন্য কোনো cost multiplier প্রকাশ করে না এবং নিজের use case পরীক্ষা করতে বলে। তাই high-এ চালানো Sonnet 5 run এবং low-এ চালানো Opus 4.8 run-এর বাস্তব তুলনা আপনি আজ বিকেলেই করতে পারেন। Effort সমর্থন করে এমন model-এর তালিকায় Haiku 4.5 নেই।

Prompt caching। Cache read-এর খরচ base input rate-এর 0.1x, আর model বাছাইয়ের ক্ষেত্রে গুরুত্বপূর্ণ বিষয় হলো tier জুড়ে এর প্রভাব। Opus 4.8-এ cache hit-এর খরচ $0.50 / MTok, আর Haiku 4.5-এ uncached input-এর খরচ $1 / MTok। তাই ভালোভাবে cache করা Opus prefix-এর প্রতি input token-এর খরচ cold Haiku prompt-এর চেয়ে কম। যে workload-এ বড়, স্থিতিশীল prefix বারবার পাঠানো হয়, সেখানে model choice-এর চেয়ে session hygiene বেশি কার্যকর।

Batches। উত্তরের জন্য কিছু অপেক্ষা না করলে Message Batches API একই model চালিয়ে "input এবং output token উভয়ের ওপর 50% discount" দেয়। এতে নিচের তুলনার প্রতিটি row অর্ধেক হয়ে যায় এবং সব tier-এ এটি কাজ করে: 1 September 2026 থেকে standard price অনুযায়ী batched Opus 4.8 job-এর খরচ synchronous Sonnet 5 job-এর চেয়ে কম। একই অর্থে capability বজায় রেখে latency বাড়ে।

একটি সম্পূর্ণ খরচের তুলনা

কাজটি হলো 100,000টি support email শ্রেণিবদ্ধ করা। প্রতিটি email-এর জন্য একবার করে call করা হবে, এবং প্রতি call-এ 2,000টি input token ও 300টি output token থাকবে। মোট input হবে 200 MTok এবং output হবে 30 MTok।

  • Haiku 4.5: 200 x $1 = $200 in, 30 x $5 = $150 out। মোট $350।
  • Sonnet 5, introductory rate: 200 x $2 = $400 in, 30 x $10 = $300 out। মোট $700।
  • Sonnet 5, 1 September 2026 থেকে: 200 x $3 = $600 in, 30 x $15 = $450 out। মোট $1,050।
  • Opus 4.8: 200 x $5 = $1,000 in, 30 x $25 = $750 out। মোট $1,750।

আগামীকালের দামে আবার হিসাব করতে চারটি সংখ্যা বদলান। নিচের সমন্বয়গুলো model name-এর চেয়েও বেশি প্রভাব ফেলে:

  • Batching প্রতিটি লাইনের খরচ অর্ধেক করে: $175, $350, $525 এবং $875। কোনো nightly classification run-এর জন্য কিছু অপেক্ষা করে না, তাই এটি বাদ দেওয়ার কারণ নেই।
  • Shared prefix cache করা। ধরা যাক, 2,000টি input token-এর মধ্যে 1,200টি প্রতিবার একই instruction block। introductory rate-এ Sonnet 5-এর ক্ষেত্রে cache hit-এর দাম $2 / MTok-এর বদলে $0.20 / MTok। তাই 120 MTok-এর খরচ $240-এর বদলে $24। এর সঙ্গে $2 দরে 80 MTok fresh input-এর জন্য $160 এবং output-এর জন্য $300 যোগ করলে Sonnet 5-এর মোট খরচ প্রায় $484 হয়, $700 নয়। Haiku 4.5-এ একই পদ্ধতিতে কোনো লাভ হয় না, কারণ 1,200 token তার 4,096-token minimum-এর নিচে।
  • Retries। ধরুন, 8% email-এর জন্য Haiku-এর উত্তর গ্রহণ করছেন না এবং সেগুলো Opus 4.8-এ আবার চালাচ্ছেন। $350-এর সঙ্গে 0.08 x $1,750 = $140 যোগ করলে মোট হয় $490। আমার rejection rate ব্যবহার না করে নিজের rejection rate মাপুন।
  • Tool definitions, যদি কাজটিতে সেগুলো ব্যবহার করা হয়। এগুলো যে system prompt তৈরি করে, তা Opus 4.8-এ tool_choice সেট করা থাকলে auto token, Sonnet 5-এ 354 token এবং Haiku 4.5-এ 496 token। সবচেয়ে সস্তা model-টির fixed overhead সবচেয়ে বেশি।

Escalation path-সহ Haiku-এর খরচ $490 এবং cached Sonnet 5-এর খরচ $484—দুটির খরচ প্রায় একই, অথচ তাদের একটি একবারেই কাজটি সম্পন্ন করে। Model কখনোই পুরো বিষয় ছিল না।

মাঝপথে model পরিবর্তন করলে কি খরচ কমে?

স্টিকার-দামের তুলনায় এটি কম ক্ষেত্রেই সাশ্রয়ী হয়, কারণ সাশ্রয়টি প্রতি token হিসেবে হিসাব করা হয়, কিন্তু ঝুঁকিতে পড়ে সম্পূর্ণ cached prefix।

Anthropic কোন বিষয়গুলো cache অকার্যকর করে তা নথিভুক্ত করেছে। Prefix-গুলো প্রথমে tools, তারপর system, এরপর messages ক্রমে তৈরি হয়, এবং “প্রতিটি স্তরে পরিবর্তন হলে সেই স্তর ও পরবর্তী সব স্তরের cache অকার্যকর হয়।” ওই তালিকায় দুটি request setting-ও আছে: “thinking configuration এবং resolved effort level prompt-এর মধ্যেই লেখা হয়। তাই এগুলোর যেকোনো একটি পরিবর্তন করলে নতুন cache prefix শুরু হয়।” effort সম্পর্কে documentation আরও স্পষ্ট: “cache hit-নির্ভর conversation-এর মধ্যে নয়, বরং workload-গুলোর মধ্যে effort পরিবর্তন করুন।”

model ওই নথিভুক্ত তালিকায় নেই। তাই কোনো দিকই অনুমান করবেন না। পরিবর্তনের পর প্রথম request-এ cache_read_input_tokens পড়ুন এবং সংখ্যাটিই সিদ্ধান্ত দিক। 150,000-token Opus 4.8 prefix-এ cache read-এর খরচ প্রায় $0.08, আর নতুন write-এর খরচ প্রায় $0.94। আপনি যে প্রতি-token পার্থক্যের জন্য model পরিবর্তন করতে চেয়েছিলেন, এটি তার কয়েকটি turn-এর খরচের চেয়েও বেশি।

তাই task-গুলোর মধ্যে এই বিষয়গুলো পরিবর্তন করুন, একই task-এর মধ্যে নয়। Claude Code-এ প্রথমে /clear চালান, কারণ তখন cache যাই হোক বাতিল হবে। এরপর /model অথবা /effort ব্যবহার করুন। এই দুটিই CLI-তে টাইপ করা হয়। তাই Linux-এ কাজ করলে terminal সংস্করণটি ইনস্টল করাই যুক্তিযুক্ত, কারণ Linux-এর জন্য Anthropic যে native সংস্করণ সরবরাহ করে সেটিতে স্থিতিশীল CLI আছে, আর desktop app এখনও beta পর্যায়ে। পরিবর্তনের খরচ bill-এ আদৌ দেখা যাবে কি না, তা নির্ভর করে আপনি ওই session-এর অর্থ কীভাবে দিচ্ছেন। কারণ Claude Code flat monthly plan অথবা per-token API credit—দুইভাবেই চলে, এবং শুধু দ্বিতীয় পদ্ধতিতেই model পরিবর্তনের দাম dollar-এ হিসাব হয়। flat plan-এ ভারী model ব্যবহার করার খরচ invoice নয়, usage window। আর Pro এবং তার পরের plan-গুলোতে Claude Code অন্তর্ভুক্ত এবং chat app-গুলোর সঙ্গে একই window ব্যবহার করে। তাই terminal-এ Opus ব্যবহার করার এক ঘণ্টা browser-এ ব্যবহার করার জন্য আপনার হাতে আর থাকে না।

নিজের workload-এ উত্তরটি কীভাবে পরীক্ষা করবেন

অন্য কোনো model থেকে নেওয়া count ব্যবহার করে prompt-এর আকার নির্ধারণ করবেন না। Token-counting endpoint বিনামূল্যে ব্যবহার করা যায় এবং আপনি যে model-এর নাম দেবেন, সেটির tokenizer দিয়ে count করে। তাই যে model কল করার পরিকল্পনা করছেন, সেটির নাম দিন। এই endpoint platform-এর কয়েকটি এমন অংশের একটি, যেগুলোর জন্য কখনো bill করা হয় না। বাস্তব credit খরচ করে comparison করার আগে আর কী কী বিনা খরচে চালাতে পারবেন তা দেখে নেওয়া উপযোগী। Opus 4.7 এবং পরবর্তী version, Fable 5 এবং Sonnet 5 নতুন tokenizer ব্যবহার করে, যা "একই text-এর জন্য প্রায় 30% বেশি token তৈরি করে"। তাই পুরোনো model-এ মাপা budget, প্রতি-token rate অপরিবর্তিত থাকলে নতুন model-এ কম পড়বে।

এরপর ফিরে আসা ফলাফল পড়ুন। input_tokens শুধু uncached remainder, তাই প্রকৃত prompt size হলো ওই field-এর সঙ্গে cache_creation_input_tokens এবং cache_read_input_tokens-এর যোগফল। একটি VPS-এ প্রথম Claude API app চালানো এই measurement চালানোর জন্য সবচেয়ে ছোট উপযুক্ত setup। আর আপনার ব্যবহারের জন্য কোন Claude plan উপযুক্ত হলো আদৌ প্রতি token-এ pay করবেন কি না, সেই আলাদা সিদ্ধান্ত। যদি বিষয়টি subscription রাখবেন কি না না হয়ে কোন subscription রাখবেন—এমন হয়, তাহলে ChatGPT-এর tier-এর পাশে Claude-এর tier-এর মূল্য তুলনা করে একই coding work-এর জন্য অন্য provider-এর seat-এ কত খরচ হয় তা দেখায়। Measurement-এর ফল যদি আপনার কাজ স্থায়ীভাবে API-তে পাঠানোর সিদ্ধান্তে নিয়ে যায়, তাহলে subscription এক tier কমানো বা পুরোপুরি বন্ধ করা হলেও আগে যে period-এর জন্য pay করেছেন, সেটি থাকবে। তাই numbers হাতে আসার পরে সিদ্ধান্ত নিলে কোনো penalty নেই। একজনের বদলে একটি team-এর জন্য একই measurement চালালে মোট হিসাব আবার ভিন্ন হবে, কারণ Team বা Enterprise seat-কে ওই ব্যক্তি প্রতি token-এ যত খরচ করতেন, তার চেয়ে বেশি সুবিধা দিতে হবে, তবেই সেটি কেনা সার্থক হবে।

FAQ

কোডিংয়ের জন্য কোন Claude model সবচেয়ে ভালো?

জটিল agentic coding-এর জন্য Claude Opus 4.8-কে নথিভুক্ত প্রাথমিক পছন্দ হিসেবে দেখানো হয়েছে। July 2026 অনুযায়ী এর মূল্য প্রতি 1 million input token-এ $5 এবং প্রতি 1 million output token-এ $25। Claude Sonnet 5-কে speed ও intelligence-এর সেরা সমন্বয় হিসেবে উপস্থাপন করা হয়েছে। 31 August 2026 পর্যন্ত এর মূল্য $2 / $10, অর্থাৎ এটি অর্ধেকেরও কম খরচের। উভয় model-এ একই task চালান, thinking configuration অপরিবর্তিত রাখুন এবং response.usage থেকে মোট token খরচ তুলনা করুন।

Claude Haiku 4.5 কি Sonnet 5-এর বিকল্প হিসেবে যথেষ্ট সস্তা?

প্রতি token হিসেবে অবশ্যই। introductory pricing-এ Sonnet 5-এর $2 / $10-এর বিপরীতে এর মূল্য $1 / $5। 1 September 2026 থেকে Sonnet 5-এর মূল্য $3 / $15 হবে। তবে সীমাবদ্ধতাগুলো সিদ্ধান্ত নির্ধারণ করে। Haiku 4.5-এ 1M-এর পরিবর্তে 200K token context window আছে। synchronous Messages API-তে সর্বোচ্চ output 64K। এর নির্ভরযোগ্য knowledge cutoff February 2025। এতে output_config.effort support নেই। এছাড়া cache করা যায় এমন prompt-এর ন্যূনতম আকার 4,096 token, ফলে ছোট system prompt-এ caching নীরবে বন্ধ হয়ে যায়।

Session চলাকালীন সস্তা Claude model-এ পরিবর্তন করলে কি খরচ কমে?

দেখতে যতটা মনে হয়, তার চেয়ে কম ক্ষেত্রেই কমে। Anthropic cache invalidator হিসেবে tools, system বা messages prefix-এ পরিবর্তন, thinking configuration-এ পরিবর্তন এবং output_config.effort-এ পরিবর্তনের কথা উল্লেখ করেছে। Model পরিবর্তন করলে বিদ্যমান cache-এর ওপর কী প্রভাব পড়ে, তা নথিভুক্ত নয়। তাই এটিকে অজানা হিসেবে বিবেচনা করুন এবং পরের প্রথম request-এ cache_read_input_tokens পড়ুন। বিষয়টি জানা গুরুত্বপূর্ণ। 150,000-token Opus 4.8 prefix-এ cache read-এর খরচ প্রায় $0.08 এবং নতুন write-এর খরচ প্রায় $0.94। এই খরচ প্রতি token সাশ্রয়ের কয়েকটি turn-এর চেয়েও বেশি হতে পারে। Task-এর মাঝখানে নয়, task বদলানোর সময় model পরিবর্তন করুন। Claude Code-এ /clear-এর পর পরিবর্তন করুন, যখন cache যেভাবেই হোক বাতিল হচ্ছে।

output_config.effort আমার বিলের ওপর কী প্রভাব ফেলে?

এটি text, tool call এবং thinking-এ model কত token খরচ করবে তা পরিবর্তন করে। কম effort-এ tool call কম হয়। Agentic loop-এ এর প্রভাব বাড়ে, কারণ পরের turn-গুলোতে প্রতিটি tool result আবার পাঠানো হয়। স্তরগুলো হলো low, medium, high, xhigh এবং max। ডিফল্ট হলো high। Anthropic প্রতি স্তরের জন্য কোনো cost multiplier প্রকাশ করেনি। তাদের মতে effort token budget নয়, বরং একটি behavioral signal। তাই নিজের task-এ এটি মেপে দেখুন।

Claude Batches API ব্যবহার করলে কত খরচ বাঁচে?

Asynchronous delivery গ্রহণ করলে input ও output উভয় token-এ 50% সাশ্রয় হয়। July 2026 অনুযায়ী এতে Opus 4.8-এর মূল্য দাঁড়ায় $2.50 in / $12.50 out, introductory pricing-এ Sonnet 5-এর $1 / $5, এবং Haiku 4.5-এর $0.50 / $2.50। যে তুলনাটি গুরুত্বপূর্ণ, তা tier-গুলোর মধ্যে। 1 September 2026 থেকে standard rate-এ synchronous Sonnet 5 job-এর চেয়ে batched Opus 4.8 job-এর খরচ কম হবে। অর্থাৎ একই খরচে batching আরও শক্তিশালী model ব্যবহারের সুযোগ দেয়।