Claude এত ব্যয়বহুল কেন? Token-এর হিসাব
Output token-এর দাম input-এর পাঁচ গুণ, আর প্রতিটি turn-এ পুরো context আবার bill হয়। একটি বাস্তব session-এর হিসাব ও খরচ কমানোর 4টি উপায় দেখুন।
Claude কেন ব্যয়বহুল? সংক্ষিপ্ত উত্তর
Claude ব্যয়বহুল হওয়ার চারটি কারণ আছে, এবং সেগুলো একে অপরের সঙ্গে যুক্ত হয়ে খরচ বাড়ায়। Output token-এর মূল্য input token-এর হারের পাঁচ গুণ। API আপনার conversation-এর কোনো memory রাখে না। তাই প্রতিটি turn-এ পুরো history আবার পাঠানো হয় এবং আবার bill করা হয়। একটি agent একটি প্রশ্নকে কয়েক ডজন API call-এ পরিণত করে। প্রতিটি call-এর সঙ্গে ক্রমশ বড় হওয়া history-ও পাঠানো হয়। এর ওপর frontier model যে কাজ করে তার কঠিনতার ভিত্তিতে মূল্য নির্ধারিত হয়, ছোট model চালানোর খরচের ভিত্তিতে নয়।
একটি token হলো text-এর একটি অংশ। আনুমানিক হিসাবে, একটি token প্রায় চারটি character বা English-এর প্রায় 0.75 word-এর সমান। Rate প্রতি million token হিসাবে উল্লেখ করা হয় এবং MTok (million tokens) লেখা হয়। নিচের প্রতিটি rate হলো August 2026 অনুযায়ী প্রকাশিত Claude API rate।
বিল অপ্রত্যাশিতভাবে বেশি হওয়ার বেশিরভাগ ঘটনা তালিকার দ্বিতীয় ও তৃতীয় কারণের জন্য ঘটে। সাধারণত মানুষ মনে করেন, Claude যে উত্তর লেখে সেটিই মূল খরচ। কিন্তু একটি agent session-এ লেখার খরচ প্রায়ই মোট বিলের এক দশমাংশেরও কম।
প্রকাশিত হার, যাতে সংখ্যাগুলো নিয়ে আমাদের মতৈক্য থাকে
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5,
"cache_read_usd": "0.10"
},
{
"label": "Sonnet 5, to Aug 31 2026",
"input_usd": 2,
"output_usd": 10,
"cache_read_usd": "0.20"
},
{
"label": "Sonnet 5, from Sep 1 2026",
"input_usd": 3,
"output_usd": 15,
"cache_read_usd": "0.30"
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25,
"cache_read_usd": "0.50"
}
]পরম সংখ্যার বদলে কাঠামোটি দেখুন। প্রতিটি model input-এর তুলনায় output-এর জন্য ঠিক পাঁচ গুণ বেশি চার্জ করে। Opus 5-এর প্রতি million input token-এর দাম 5 dollar এবং প্রতি million output token-এর দাম 25 dollar। Haiku 4.5-এর দাম যথাক্রমে 1 এবং 5। তাই সবচেয়ে সস্তা model থেকে সবচেয়ে ব্যয়বহুল model-এর ব্যবধান পাঁচ গুণ, এবং পড়া থেকে লেখার ব্যবধানও পাঁচ গুণ।
Sonnet 5-এর introductory pricing 31 August, 2026 পর্যন্ত প্রতি million token-এ 2 এবং 10 dollar। 1 September, 2026 থেকে এই হার 3 এবং 15 হবে। Model release-এর সঙ্গে হার পরিবর্তিত হয়। তাই এগুলোর ভিত্তিতে budget তৈরি করার আগে বর্তমান হার যাচাই করুন।
শেষ column-টি cache read rate। অধিকাংশ bill-এর পরিমাণ এটি নির্ধারণ করে। গাণিতিক হিসাবের পরে এই বিষয়ে ফিরব।
Output token-এর খরচ input token-এর পাঁচ গুণ কেন?
পড়া এবং লেখা একই পরিমাণ কাজ নয়। Input token একবারে process করা হয়। Model পুরো prompt একসঙ্গে পড়ে এবং কাজটি prompt-এর বিভিন্ন অংশে parallelভাবে চলে। তাই 60,000 token-এর prompt পড়তে 1,000 token-এর prompt-এর তুলনায় 60,000 গুণ বেশি সময় লাগে না।
Output token একবারে একটি করে তৈরি হয়। প্রতিটি নতুন token-এর জন্য model-কে আলাদা pass চালাতে হয় এবং তার আগে থাকা প্রতিটি token-কে context হিসেবে ব্যবহার করতে হয়। 1,000 token লেখা মানে পরপর 1,000টি pass চালানো। এই serial কাজ reading-এর মতো ছড়িয়ে দেওয়া যায় না। তাই প্রতিটি output token hardware-কে আরও বেশি সময় ব্যস্ত রাখে।
এই কারণে “উত্তরটি সংক্ষিপ্ত করুন” প্রত্যাশার তুলনায় দুর্বল নিয়ন্ত্রণপদ্ধতি। এটি agent bill-এর ছোট অংশে কাজ করে।
প্রতিটি turn-এ আমার পুরো conversation-এর জন্য আবার bill করা হচ্ছে কেন?
Claude API stateless। Anthropic-এর server-side-এ এমন কোনো conversation থাকে না, যেখানে আপনি একটি message যোগ করছেন। প্রতিটি request-এর সঙ্গে সম্পূর্ণ message history পাঠানো হয়, এবং model কোনো উত্তর লেখার আগে পুরো history পড়ে। তাই turn 30-এ turns 1 থেকে 29-এর জন্যও bill করা হয়।
এর মানে, conversation যত দীর্ঘ হয়, খরচ তার চেয়েও দ্রুত বাড়ে। Turn 1-এ ছোট context-এর জন্য bill হয়। Turn 40-এ বড় context-এর জন্য bill হয়। সব 40টি turn-এর খরচ যোগ করলে দেখা যায়, মোট যত token কখনো লেখা হয়েছে তার চেয়ে অনেক গুণ বেশি token-এর জন্য আপনি অর্থ দিয়েছেন।
The data behind this chart
[
{
"turn": 1,
"context_tokens": "20,000"
},
{
"turn": 5,
"context_tokens": "32,000"
},
{
"turn": 10,
"context_tokens": "45,000"
},
{
"turn": 15,
"context_tokens": "55,000"
},
{
"turn": 20,
"context_tokens": "64,000"
},
{
"turn": 25,
"context_tokens": "74,000"
},
{
"turn": 30,
"context_tokens": "84,000"
},
{
"turn": 35,
"context_tokens": "92,000"
},
{
"turn": 40,
"context_tokens": "100,000"
}
]উপরের session শুরু হয়েছে 20,000 token দিয়ে। এর মধ্যে রয়েছে system prompt, tool definitions এবং agent-এর খোলা প্রথম files। 40 turn-এ context-এ 100,000 token থাকে। সব 40টি turn-এর উপর গড় করলে প্রতি request-এ প্রায় 60,000 token পড়া হয়।
একটি chat-এর তুলনায় agent-এর খরচ এত বেশি কেন?
একটি chat-এ প্রতিটি প্রশ্নের জন্য একটি request হয়। একটি agent-এ প্রতিটি ধাপের জন্য একটি request হয়। একটি file পড়া একটি ধাপ। একটি test চালানো একটি ধাপ। test-এর output পড়া একটি ধাপ। file সম্পাদনা করা একটি ধাপ। একটি কাজ শেষ করতে 40টি ধাপ লাগা coding agent-এর ক্ষেত্রে স্বাভাবিক।
Tool ব্যবহারের সঙ্গে আরও দুটি অতিরিক্ত খরচ যুক্ত হয়। প্রতিটি request-এ tool definition input token হিসেবে গণনা হয়, কারণ model-কে প্রতিবার জানাতে হয় কোন tool বিদ্যমান। Anthropic এই overhead প্রকাশ করেছে: tool_choice-কে auto-এ সেট করলে Opus 5-এ tool use system prompt-এর জন্য 286 token লাগে; এর সঙ্গে আপনার নিজস্ব tool schema-এর token-ও যোগ হয়। কিছু server-side tool-এর জন্য আলাদা fee-ও প্রযোজ্য। ফলাফলে ব্যবহৃত token-এর অতিরিক্ত, web search-এর জন্য প্রতি 1,000 search-এ $10 বিল করা হয়।
প্রতিটি tool result-ও স্থায়ী context হয়ে থাকে। কোনো command 3,000টি line output করলে, session-এর বাকি সময় প্রতিটি request-এ ওই 3,000টি line যুক্ত থাকে। Claude Code যে per-session token usage দেখায় তা বিষয়টি স্পষ্ট করে: noisy command চালানোর পর input number বাড়তে দেখুন।
একটি বাস্তব সেশনের হিসাব
এখানে Opus 5-এ agentic coding-এর একটি বাস্তবসম্মত ঘণ্টার হিসাব দেখানো হলো। মোট 40টি API request হয়েছে। Context 20,000 থেকে 100,000 token পর্যন্ত বেড়েছে, তাই প্রতি request-এ গড়ে প্রায় 60,000 token ছিল। Model প্রতি request-এ প্রায় 700 token লিখেছে। এর মধ্যে সংক্ষিপ্ত tool call এবং কয়েকটি তুলনামূলক দীর্ঘ code block রয়েছে।
Requests in the session: 40
Average context per request: 60,000 tokens
Total input tokens billed: 40 x 60,000 = 2,400,000
Input cost on Opus 5: 2,400,000 x $5 / 1,000,000 = $12.00
Total output tokens: 40 x 700 = 28,000
Output cost on Opus 5: 28,000 x $25 / 1,000,000 = $0.70
Session total = $12.70The data behind this chart
[
{
"label": "Input, context re-read",
"billed_tokens": "2,400,000",
"cost_usd": "12.00"
},
{
"label": "Output, code and tool calls",
"billed_tokens": "28,000",
"cost_usd": "0.70"
}
]বিভাজনটি লক্ষ্য করুন। পড়ার খরচ 12.00 dollar এবং লেখার খরচ 0.70 dollar। তাই আপনি যে output আসলে পড়েছেন, তা মোট bill-এর প্রায় পাঁচ শতাংশ। Model 28,000 token লিখেছে এবং পড়ার জন্য 2,400,000 token-এর bill হয়েছে। কেউ 2.4 million token type করেনি। একই 100,000 token বারবার পড়া হয়েছে।
লিভার 1: prompt caching, এটিই সবচেয়ে বড় লিভার
Prompt caching আপনার prompt-এর স্থিতিশীল prefix-এর processed form সংরক্ষণ করে। পরের request-এ সেই prefix আবার process না করে cache থেকে পড়া হয়। পাঁচ মিনিটের cache-এ cache-এ লেখার খরচ input rate-এর 1.25 গুণ, আর এক ঘণ্টার cache-এ 2 গুণ। cache থেকে পড়ার খরচ input rate-এর 0.1 গুণ। Opus 5-এ প্রতি মিলিয়ন tokens-এর খরচ 0.50 dollars, যেখানে cache ব্যবহার না করলে খরচ 5 dollars।
উপরের session-এ এটি প্রয়োগ করুন। Conversation বাড়ার সঙ্গে 100,000 tokens-এর প্রতিটি token একবার করে cache-এ লেখা হয়। বাকি 2,300,000 input tokens cache read হিসেবে গণ্য হয়।
Tokens written to cache: 100,000
Cache write at 1.25x input: 100,000 x $6.25 / 1,000,000 = $0.63
Tokens read from cache: 2,300,000
Cache read at 0.1x input: 2,300,000 x $0.50 / 1,000,000 = $1.15
Output cost, unchanged = $0.70
Session total = $2.48আপনি cache করা যাবে এমন অংশটি cache_control field দিয়ে চিহ্নিত করেন। যে content turns-এর মধ্যে পরিবর্তিত হয় না, তার পরে breakpoint বসান: system prompt এবং tool definitions-এর পরে। আপনি যে দীর্ঘ document বারবার ব্যবহার করেন, সেটিও একই স্থিতিশীল block-এর মধ্যে রাখুন।
{
"model": "claude-opus-5",
"system": [
{
"type": "text",
"text": "<long, stable instructions>",
"cache_control": {"type": "ephemeral"}
}
],
"messages": [{"role": "user", "content": "..."}]
}এখন আপনার prompt-এর order খরচ নির্ধারণ করে। Cache hit-এর জন্য prompt-এর একেবারে শুরু থেকে exact match প্রয়োজন। তাই প্রতিটি request-এ পরিবর্তিত হয় এমন সবকিছু অপরিবর্তিত অংশের পরে রাখতে হবে। আপনার system prompt-এর শুরুতে timestamp রাখলে প্রতিটি turn-এ cache ভেঙে যাবে: পুরো prefix cache miss হবে, এবং সেটি আবার লিখতে input rate-এর 1.25 গুণ খরচ হবে।
কাজটি সফল হয়েছে কি না, response তা জানায়। একটি request পাঠান এবং usage block পড়ুন।
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-opus-5",
"max_tokens": 256,
"messages": [{"role": "user", "content": "Hello"}]
}'প্রতিটি response-এ এর মতো একটি usage object থাকে:
{
"usage": {
"input_tokens": 105,
"cache_creation_input_tokens": 7345,
"cache_read_input_tokens": 7123,
"output_tokens": 239
}
}Repeat request-এ cache_read_input_tokens-এর মধ্যে এখনও 0 দেখা গেলে cache hit হচ্ছে না। সাধারণত এর কারণ breakpoint-এর আগের কোনো content পরিবর্তিত হয়েছে। পাঁচ মিনিটের cache-এর মেয়াদও শেষ হয়। তাই ছয় মিনিট পরে পাঠানো request cache miss হবে এবং এরপর নতুন করে cache write হবে।
লিভার 2: সহজ কাজগুলো ছোট মডেলে পাঠান
Agent session-এর অধিকাংশ turn কঠিন নয়। কোনো file খোলা, formatter চালানো, diff পড়া—এসবের জন্য frontier model প্রয়োজন হয় না। এগুলো Haiku 4.5-এ পাঠালে প্রতি million input-এর খরচ 5 dollar থেকে কমে 1 dollar হয়।
The data behind this chart
[
{
"label": "Opus 5, no caching",
"session_cost_usd": "12.70"
},
{
"label": "Opus 5, cached",
"session_cost_usd": "2.48"
},
{
"label": "Sonnet 5, cached",
"session_cost_usd": "0.99"
},
{
"label": "Haiku 4.5, cached",
"session_cost_usd": "0.50"
}
]একই session-এ caching ছাড়া Opus 5 ব্যবহার করলে খরচ 12.70 dollar, caching ব্যবহার করলে 2.48 dollar, caching-সহ Sonnet 5 ব্যবহার করলে 0.99 dollar, এবং caching-সহ Haiku 4.5 ব্যবহার করলে 0.50 dollar। শুধু caching ব্যবহার করলেই bill-এর প্রায় আশি শতাংশ কমে। Model নির্বাচন করলে অবশিষ্ট খরচের অধিকাংশও কমে যায়।
তবে একটি গুরুত্বপূর্ণ সীমাবদ্ধতা আছে। সস্তা model ভুল উত্তর দিলে পুরো session আবার চালানোর খরচ আপনাকেই দিতে হবে। এর সঙ্গে আপনার নিজের সময়ও যোগ হবে। তাই price নয়, task কতটা কঠিন তার ভিত্তিতে routing করুন। Opus, Sonnet এবং Haiku-এর মধ্যে নির্বাচন প্রতিটি model কোন ধরনের কাজে নির্ভরযোগ্য থাকে তা ব্যাখ্যা করে।
লিভার 3: context hygiene
আপনি context-এ যে প্রতিটি token রেখে দেন, পরবর্তী প্রতিটি turn-এ তার জন্য বিল দিতে হয়। তাই কোনো token দেরিতে সরানোর চেয়ে দ্রুত সরানো অনেক বেশি সাশ্রয়ী। 40 turn-এর একটি session-এর 5 নম্বর turn-এ 5,000 token-এর একটি file dump করলে সেটি আরও 35 বার পড়া হয়। এতে অতিরিক্ত 175,000 input token যোগ হয়, যা একটি অসতর্ক paste-এর জন্য Opus 5-এ প্রায় এক dollar খরচের সমান।
এই সংখ্যা কমাতে চারটি অভ্যাস কার্যকর:
- গতকালের session চালিয়ে না গিয়ে নতুন task-এর জন্য নতুন session শুরু করুন।
- output model-এ পৌঁছানোর আগে
head -50-এর মতো কিছু ব্যবহার করে noisy command filter করুন, পরে নয়। - পুরো file না চেয়ে আপনার প্রয়োজনীয় একটি function-এর অনুরোধ করুন।
- দীর্ঘ session-এ কাজ এগোনো বন্ধ হলে একটি summary চাইুন এবং সেটি থেকে আবার শুরু করুন। summary-তে কয়েকশো token থাকে। transcript-এ থাকে একশো হাজার।
Lever 4: ইন্টারঅ্যাক্টিভ নয় এমন সবকিছু batch করুন
Batch API অনুরোধগুলো asynchronousভাবে process করে এবং input ও output—উভয়ের খরচ 50 percent কমায়। কোনো job-এর উত্তর পরবর্তী এক সেকেন্ডের মধ্যে প্রয়োজন না হলে সেটিকে batch করুন। এর মধ্যে classification, extraction, backlog-এর summarising এবং evaluation run অন্তর্ভুক্ত। Batch discount, prompt caching-এর discount-এর সঙ্গেও প্রযোজ্য হয়। Interactive session-এ এটি প্রযোজ্য নয়, কারণ সেখানে অপেক্ষা করার মতো কোনো কাজ থাকে না।
আমি কি বেশি টাকা দিচ্ছি?
“Claude কেন ব্যয়বহুল”—এর অন্তর্নিহিত আসল প্রশ্ন এটিই। তাই সরাসরি উত্তর দিচ্ছি। মূল্যহার প্রকাশ্য, standard tier-এ সবার জন্য একই, এবং token অনুযায়ী চার্জ করা হয়। বিলের কোনো অংশ ইচ্ছামতো নির্ধারিত নয়। তবে এই rate card আপনাকে বলে না যে আপনি যথেষ্ট মূল্য পাচ্ছেন কি না, কারণ এটি token-এর দাম নির্ধারণ করে, আর আপনার কাছে গুরুত্বপূর্ণ হলো ফলাফল।
তাই ফলাফলের ভিত্তিতে খরচ হিসাব করুন। উপরের session-টির uncached খরচ ছিল 12.70 dollars। এটি যদি এমন একটি feature release করে থাকে, যা তৈরি করতে আপনার এক ঘণ্টা লাগত, তাহলে খরচ কম। কিন্তু এটি যদি চল্লিশটি turn ধরে একই বিষয়ে ঘুরপাক খেয়ে থাকে, তাহলে একই 12.70 dollars দিয়ে কিছুই পাওয়া যায়নি। সে ক্ষেত্রে rate কখনোই আসল সমস্যা ছিল না।
এই বিষয়টি মনে রাখা গুরুত্বপূর্ণ। আপনার বিল value অনুযায়ী নয়, token অনুযায়ী বাড়ে। একই দৈর্ঘ্যের একটি productive session এবং একটি wasted session-এর খরচ সমান। তাই rate card-এর চেয়ে চারটি lever বেশি গুরুত্বপূর্ণ: প্রতি token-এর দাম আপনি আলোচনা করে কমাতে পারবেন না, কিন্তু কাজটি সম্পন্ন করতে কত token লাগবে তা আপনি নির্ধারণ করেন।
তাই প্রতি মাসে কত dollars খরচ হচ্ছে তা নয়, প্রতিটি সম্পন্ন task-এর জন্য কত dollars লাগছে তা হিসাব করুন। caching ও routing সামঞ্জস্য করার সময় যদি এই সংখ্যা কমে, তাহলে আপনার setup উন্নত হচ্ছে—মাসিক মোট খরচ বাড়লেও। কারণ মোট খরচ বাড়ছে বেশি কাজ সম্পন্ন করার ফলে।
কোন বিষয়গুলো আপনার বিল কমায় না
কিছু প্রচলিত পরামর্শের বাস্তবে খুব কম প্রভাব থাকে। মডেলকে "সংক্ষিপ্ত হতে" বললে output কমে, আর উদাহরণ বিলের মাত্র পাঁচ শতাংশ ছিল output। নিজের প্রশ্ন সংক্ষিপ্ত করলে 60,000 token-এর context-এর তুলনায় কয়েকশ token সাশ্রয় হয়। extended thinking বন্ধ করলে কেবল তখনই উপকার হয়, যখন thinking token আপনার output-এর উল্লেখযোগ্য অংশ ছিল। usage block সেটি আপনাকে অনুমান করতে না দিয়ে জানিয়ে দেয়।
বড় context window নিজে কোনো অতিরিক্ত খরচ নয়। Claude 4.6 এবং পরবর্তী সংস্করণে সম্পূর্ণ এক million token window-এর জন্য standard per-token rate প্রযোজ্য। তাই 900,000 token-এর request-এ প্রতি token-এর খরচ 9,000 token-এর request-এর সমান। window size মূল্য নির্ধারণ করে না। আপনি window-তে কী রাখছেন, সেটিই খরচ নির্ধারণ করে।
আরও দুটি বিষয় একটি নির্দিষ্ট session-এর বদলে পরিকল্পনার পর্যায়ে বিবেচনা করা উচিত। আপনার ব্যবহার যদি দৈনিক ও interactive হয়, তাহলে pay per token এবং flat plan-এর খরচ তুলনা করুন: API ও subscription খরচের তুলনা সেই হিসাব দেখায়। কোনো agent যদি server-এ unattended অবস্থায় চলে, তাহলে অন্য কিছু সামঞ্জস্য করার আগে hard spend cap নির্ধারণ করুন; VPS-এ AI agent-এর খরচ নিয়ন্ত্রণ এই বিষয়টি ব্যাখ্যা করে। মোটামুটি পরিমাণ বোঝার জন্য এক million Claude token-এ বাস্তবে কী পাওয়া যায় rate card-কে text-এর পৃষ্ঠায় রূপান্তর করে দেখায়।
FAQ
এজেন্ট ব্যবহার শুরু করার পর আমার Claude বিল বেড়ে গেল কেন?
কারণ একটি এজেন্ট প্রতি প্রশ্নে অনেকগুলো request পাঠায়, এবং প্রতিটি request-এর সঙ্গে তখন পর্যন্ত পুরো conversation পাঠানো হয়। একটি chat প্রতি প্রশ্নে একটি request পাঠায়। একটি coding agent প্রতি ধাপে একটি request পাঠায়, আর একটি task-এর জন্য চল্লিশটি ধাপ স্বাভাবিক। প্রতিটি request-এর সম্পূর্ণ context অনুযায়ী বিল হয়। তাই 100,000 tokens-এ শেষ হওয়া একটি session-এর জন্য মোট দুই মিলিয়নেরও বেশি input tokens-এর বিল হতে পারে। এটি সরাসরি দেখতে API response-এ input_tokens এবং cache_read_input_tokens পড়ুন।
Prompt caching কি সত্যিই বিল এতটা কমায়?
উদাহরণে cache read-এর খরচ input rate-এর এক-দশমাংশ হওয়ায় session cost 12.70 dollar থেকে 2.48 dollar-এ নেমেছিল। সাশ্রয় সম্পূর্ণভাবে আপনার hit rate-এর ওপর নির্ভর করে। পাঁচ মিনিটের cache-এ একটি read-এর পরই খরচ উঠে আসে, কারণ write-এর খরচ input-এর 1.25 গুণ এবং read-এর খরচ 0.1 গুণ। প্রতিটি request-এর শুরুতেই যদি আপনার prompt পরিবর্তিত হয়, তাহলে কোনো hit পাবেন না এবং বিনা কারণে write premium দেবেন। কাজ করছে ধরে নেওয়ার আগে cache_read_input_tokens দিয়ে নিশ্চিত করুন।
সবকিছুর জন্য কি Haiku ব্যবহার করা উচিত?
না। প্রতি মিলিয়ন input tokens-এর জন্য Haiku 4.5-এর খরচ 1 dollar, যেখানে Opus 5-এর খরচ 5 dollar। তাই classification এবং routing-এর মতো সহজ, বেশি পরিমাণের কাজে সাশ্রয় বাস্তব। কঠিন কাজে ভুল উত্তর হলে model যে খরচ বাঁচিয়েছে, তার চেয়ে ক্ষতি বেশি হয়। কারণ retry-এর খরচ এবং আপনার নিজের সময়—দুটিই অতিরিক্ত দিতে হয়। কার্যকর পদ্ধতি হলো মিশ্র ব্যবহার: যান্ত্রিক ধাপের জন্য ছোট model, আর বিচক্ষণতা প্রয়োজন এমন ধাপের জন্য frontier model।
Claude subscription-এর চেয়ে API কি সস্তা?
আপনার ব্যবহার কতটা নিয়মিত, তার ওপর নির্ভর করে। একটি subscription হলো নির্দিষ্ট মাসিক মূল্য, যার সঙ্গে usage limit যুক্ত থাকে। API-তে কোনো ceiling ছাড়াই token অনুযায়ী অর্থ দিতে হয়। তাই ব্যবহার কম হলে বা মাঝে মাঝে বেশি হলে API সস্তা হতে পারে, আর প্রতিটি কর্মদিবসে বেশি ব্যবহার করলে ব্যয়বহুল হতে পারে। usage block থেকে প্রতিদিনের গড় token সংখ্যা নিন, আপনার model-এর rate অনুযায়ী তার মূল্য হিসাব করুন, তারপর সেই অঙ্কের সঙ্গে plan price তুলনা করুন।