Claude বনাম ChatGPT API: কোনটি সস্তা?
Claude ও ChatGPT API-এর খরচ একবারে বুঝুন। token-এর হিসাব, তিনটি বাস্তব কাজের নির্দিষ্ট ব্যয় এবং কোন পরিস্থিতিতে Claude-এর বিল বেশি হয়, তা দেখুন।
সংক্ষিপ্ত উত্তর
Claude বনাম ChatGPT API মূল্যের ক্ষেত্রে একক কোনো বিজয়ী নেই, কারণ দুই প্রদানকারী প্রতিটি টিয়ারে ইনপুট ও আউটপুটের জন্য ভিন্নভাবে মূল্য নির্ধারণ করে। August 2026 অনুযায়ী, Claude-এর উপরের দুটি টিয়ারে তাদের OpenAI সমতুল্য টিয়ারের মতোই প্রতি ইনপুট টোকেনের মূল্য, কিন্তু প্রতি আউটপুট টোকেনের মূল্য কম। তাই আউটপুট-নির্ভর কাজে Claude সামান্য এগিয়ে থাকে। ছোট টিয়ারে একই কাজের জন্য Claude-এর খরচ কয়েক গুণ বেশি। কোনো উত্তরে টিয়ার এবং টোকেনের মিশ্রণ উল্লেখ না থাকলে সেটি অনুমানমাত্র।
এই পৃষ্ঠায় প্রথমে হিসাব দেখানো হয়েছে। এরপর টোকেনের মিশ্রণসহ খরচ নির্ণয় করা তিনটি কাজের উদাহরণ দেওয়া হয়েছে। শেষে এমন গুণকগুলো ব্যাখ্যা করা হয়েছে, যেগুলো শিরোনামে দেওয়া হারের চেয়ে বাস্তব বিলকে আরও বেশি প্রভাবিত করে।
আপনার প্রয়োজনীয় একমাত্র সূত্র
উভয় API একইভাবে টেক্সটের জন্য বিল করে। আপনি যে token পাঠান তার জন্য অর্থ প্রদান করেন, এবং model যে token লিখে ফেরত দেয় তার জন্য বেশি rate প্রদান করেন।
cost = (input tokens / 1,000,000) * input rate + (output tokens / 1,000,000) * output rate
একটি token ইংরেজিতে প্রায় 4টি character, অর্থাৎ একটি word-এর প্রায় 0.75 অংশ। প্রাথমিক হিসাবের জন্য কেবল এই মান ব্যবহার করুন। প্রকৃত বিলের জন্য প্রতিটি response-এর usage object-এ API যে count ফেরত দেয়, তা ব্যবহার করুন।
# Rates are US dollars per million tokens.
def cost(in_tok, out_tok, in_rate, out_rate):
return in_tok / 1e6 * in_rate + out_tok / 1e6 * out_rate
# One support-chat turn: 1,400 tokens in, 220 tokens out, on a $2 / $10 model.
print(round(cost(1400, 220, 2.0, 10.0), 6))স্ক্রিপ্টটি 0.005 প্রিন্ট করে, যা প্রতি turn-এ অর্ধেক cent। এক মাসে যত turn প্রত্যাশা করেন, তার সঙ্গে এটি গুণ করলে আপনার budget পাওয়া যাবে। এই একটি সূত্র শিখে নিন। এরপর আজকের পর প্রতিটি price change নতুন analysis না করে এক লাইনের edit-এ করা যাবে।
প্রকাশিত মূল্যহার, August 2026
এগুলো হলো উভয় বিক্রেতা 1 August 2026-এ প্রকাশিত তালিকামূল্য। এই পোস্টে মূল্য লেখার একমাত্র স্থান হলো এই ব্লক। বাজেট অনুমোদনের আগে claude.com/pricing এবং OpenAI-এর pricing page-এর সঙ্গে এটি মিলিয়ে দেখুন।
The data behind this chart
[
{
"label": "Frontier",
"claude_input": 5,
"claude_output": 25,
"openai_input": 5,
"openai_output": 30
},
{
"label": "Workhorse",
"claude_input": 2,
"claude_output": 10,
"openai_input": 2,
"openai_output": 12
},
{
"label": "Workhorse from September",
"claude_input": 3,
"claude_output": 15,
"openai_input": 2,
"openai_output": 12
},
{
"label": "Small",
"claude_input": 1,
"claude_output": 5,
"openai_input": 0.2,
"openai_output": 1.2
}
]প্রতিটি lineup-এ অবস্থান অনুযায়ী জোড়া নির্ধারণ করা হয়েছে, খ্যাতি অনুযায়ী নয়। Frontier হলো Claude Opus 5 বনাম gpt-5.6-sol। Workhorse হলো Claude Sonnet 5 বনাম gpt-5.6-terra। Small হলো Claude Haiku 4.5 বনাম gpt-5.6-luna। উভয় বিক্রেতাই এই ব্লকের ওপরে আরও উচ্চতর tier বিক্রি করে, এবং OpenAI পুরোনো generation-গুলো তাদের মূল হারে তালিকাভুক্ত রাখে। এক পাশে flagship এবং অন্য পাশে budget model তুলনা করলে এমন একটি সংখ্যা পাওয়া যায় যার কোনো অর্থ নেই। অধিকাংশ প্রকাশিত তুলনা headline তৈরি করে এভাবেই।
এই ব্লকের দুটি বিষয় স্পষ্ট করে বলা দরকার। Sonnet 5-এর 2 এবং 10 introductory rate, এবং Anthropic নথিভুক্ত করেছে যে এগুলো 31 August 2026-এ শেষ হবে। এরপর Sonnet 5-এর মূল্য হবে 3 এবং 15। এই একটি পরিবর্তন workhorse tier-কে সামান্য Claude জয় থেকে স্পষ্ট OpenAI জয়ে পরিণত করে, এবং এই পোস্টের প্রাসঙ্গিক সময়সীমার মধ্যেই তা কার্যকর হবে।
দ্বিতীয় বিষয়টি মনে রাখার মতো একটি ধারা: উপরের প্রতিটি সারিতে Claude তার নিজস্ব input rate-এর ঠিক 5 গুণ output-এর মূল্য নির্ধারণ করে, আর OpenAI নির্ধারণ করে 6 গুণ। পরম rate নয়, এই অনুপাতই আপনার token mix অনুযায়ী বিজয়ী পরিবর্তন করে।
কেন প্রতি মিলিয়ন টোকেনের হার বিভিন্ন vendor-এর মধ্যে তুলনাযোগ্য নয়
হার হলো প্রতি token-এর জন্য dollar। বিল হলো প্রতি token-এর dollar-কে token-এর সংখ্যা দিয়ে গুণ করা। কোনো text-এর token-এর সংখ্যা model-এর বৈশিষ্ট্য, text-এর নয়।
Anthropic এটি সরাসরি নথিভুক্ত করেছে: Claude 4.7 এবং পরবর্তী model, যার মধ্যে Claude Opus 5 এবং Claude Sonnet 5 রয়েছে, একটি নতুন tokenizer ব্যবহার করে। একই text-এর জন্য এই tokenizer Claude Sonnet 4.6 এবং তার আগের model-এর তুলনায় প্রায় 30% বেশি token তৈরি করে। হার পরিবর্তন হয়নি। বিল পরিবর্তিত হয়েছে।
তাই দেখতে একই রকম দুটি হার থেকে একই রকম দুটি বিল হয় না। উভয় পক্ষের token গণনা করুন এবং নিজের text ব্যবহার করুন। এই তুলনাসহ কোনো তুলনার ওপর আস্থা রাখার আগে এটি করুন।
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5",
"messages": [{"role": "user", "content": "Summarise the attached contract."}]
}'একটি সঠিক response হলো একটি ছোট JSON object, যার মধ্যে input_tokens থাকে। 401 মানে আপনার shell-এ key variable খালি। একই text অন্য vendor-এর tokenizer-এর মাধ্যমে চালান। একটি count-কে অন্য count দিয়ে ভাগ করুন। তুলনা করার আগে প্রকাশিত rate-এ সেই ratio গুণ করুন। যদি ratio একটি vendor-কে প্রায় 1.2-এর বেশি সুবিধা দেয়, তাহলে উপরের block-এর প্রতিটি rate পার্থক্যের চেয়ে তার প্রভাব বেশি।
পরিস্থিতি এক: একটি চ্যাট ফিচার
একটি web application-এর ভেতরে থাকা support assistant। প্রতি মাসে 120,000টি turn। প্রতিটি turn-এ একটি system prompt, tool schemas, help desk থেকে retrieved দুটি snippet এবং আগের কয়েকটি message পাঠানো হয়; মোট প্রায় 1,400টি input token। Model প্রায় 220টি token-এ উত্তর দেয়। এটি interactive, তাই এখানে batch discount কখনও প্রযোজ্য হবে না। এটি workhorse tier-এ চালান।
The data behind this chart
[
{
"label": "List price",
"claude_usd": "600.00",
"openai_usd": "652.80"
},
{
"label": "Cached prefix",
"claude_usd": "427.20",
"openai_usd": "480.00"
},
{
"label": "Small tier, cached",
"claude_usd": "213.60",
"openai_usd": "48.00"
}
]List price-এ Claude-এর বিল 600.00, আর OpenAI-এর বিল 652.80। Input-এর হার একই হওয়ায় input অংশের খরচও একই। পুরো পার্থক্য output-এ, এবং Claude-এর সাশ্রয় এত কম যে শুধু এই কারণে কোনো vendor বেছে নেওয়া যায় না।
এখন ওই 1,400টি input token-এর মধ্যে 800টিকে একটি স্থিতিশীল prefix হিসেবে চিহ্নিত করুন: system prompt এবং tool schemas, যেগুলো turn-এর মধ্যে পরিবর্তিত হয় না। উভয় vendor cache hit-এর জন্য তাদের base input rate-এর 10% চার্জ করে। Claude-এর বিল কমে হয় 427.20, আর OpenAI-এর বিল হয় 480.00। Caching-এর প্রভাব vendor বেছে নেওয়ার চেয়ে বেশি, এবং উভয় platform-ই এটি সমর্থন করে।
এখানেই Claude পিছিয়ে পড়ে। বেশিরভাগ support answer-এর জন্য workhorse model প্রয়োজন হয় না। একই traffic small tier-এ সরিয়ে নিলে Claude-এর বিল হয় 213.60, আর OpenAI-এর বিল হয় 48.00। একটির খরচ অন্যটি দিয়ে ভাগ করলে দেখা যায়, একই কাজের জন্য Claude-এর খরচ প্রায় সাড়ে চার গুণ। Claude Haiku 4.5 প্রতি million input token-এ 1 চার্জ করে, যেখানে gpt-5.6-luna চার্জ করে 0.2। কোনো caching-ই পাঁচ গুণের এই পার্থক্য দূর করতে পারে না। আপনার workload যদি small model-এ চলে, OpenAI সস্তা এবং ব্যবধানও বড়।
পরিস্থিতি দুই: দীর্ঘ-প্রসঙ্গের ডকুমেন্ট pipeline
প্রতি মাসে 25,000টি contract। প্রতিটি request-এ একই 9,000-token instruction এবং JSON schema থাকে। এরপর থাকে contract-এর 12,000 token text। Model প্রায় 700 token-এর structured field ফেরত দেয়। এই job-এ output মোট token-এর 4%-এরও কম। এই একটি তথ্যই তুলনাটি নির্ধারণ করে।
The data behind this chart
[
{
"label": "Chat feature",
"claude_usd": "427.20",
"openai_usd": "480.00"
},
{
"label": "Document pipeline",
"claude_usd": "820.00",
"openai_usd": "855.00"
},
{
"label": "Coding agent",
"claude_usd": "116.10",
"openai_usd": "124.20"
}
]দুই পাশেই 9,000-token prefix cache করা থাকলে, Claude-এর bill হবে 820.00 এবং OpenAI-এর bill হবে 855.00। Input-এর খরচ cent পর্যন্ত একই, কারণ August 2026-এ উভয়ের workhorse input rate একই। পুরো পার্থক্য output leg-এ। Claude-এ output-এর দাম input-এর 5 গুণ, আর OpenAI-এ 6 গুণ।
এই job-এ batch-ও ব্যবহার করা যায়। উভয় vendor asynchronous work-এর input এবং output-এ 50% ছাড় দেয়। তাই উভয়ের total অর্ধেক হয় এবং পার্থক্যের অনুপাত অপরিবর্তিত থাকে। যেকোনো platform-এ batch-ই একক বৃহত্তম discount। Nightly document pipeline-এ এটি সবসময় ব্যবহার করা যায়।
আগের মতোই একই tier logic-এর কারণে Claude পিছিয়ে পড়ে। Fixed schema অনুযায়ী field extraction এমন কাজ, যা small model ভালোভাবে করতে পারে। এখানে মোট token-এর 97% হলো input। এক tier নিচে নামলে OpenAI-এর input rate 0.1 গুণ এবং Claude-এর input rate 0.5 গুণ হয়। বড় model প্রয়োজন বলে ধরে নেওয়ার আগে 200টি document-এ small model পরীক্ষা করুন। কাজের জন্য সঠিক Claude tier বেছে নেওয়ার সময় যে evaluation চালাবেন, একই evaluation ব্যবহার করুন।
পরিস্থিতি তিন: সবসময় চালু থাকা coding agent
একজন developer একটি VPS-এ agent চালান এবং মাসে আনুমানিক 900টি model turn ব্যবহার করেন। প্রতিটি turn-এ repository context হিসেবে প্রায় 60,000টি input token থাকে। এর 80% cache hit। প্রতিটি turn প্রায় 1,800টি edit ও ব্যাখ্যার token তৈরি করে। এটি frontier tier অনুযায়ী মূল্য নির্ধারণ করুন, কারণ coding-এর ক্ষেত্রে সক্ষমতার পার্থক্যের জন্য বাস্তব অর্থ খরচ হয়।
Claude-এর বিল 116.10, যেখানে OpenAI-এর বিল 124.20। Input rate একই, cache read rate একই, এবং Claude-এর কম output rate-এর কারণে খরচ প্রায় 7% কম।
এই 7% আগের tokenizer error bar-এর মধ্যেই পড়ে। তাই rate-এর দিক থেকে এই পরিস্থিতিকে সমতা হিসেবে বিবেচনা করুন। তবে billing model-এর ক্ষেত্রে সমতা নেই। এই পরিমাণ ব্যবহারে একজন developer-এর জন্য subscription seat সাধারণত metered API call-এর চেয়ে কম খরচের হয়। একটি subscription seat যুক্ত করলে পুরো তুলনাটিই বদলে যায়। Agent-কে metered billing-এ দেওয়ার আগে API ও subscription cost-এর তুলনা ব্যবহার করে বিষয়টি বিশ্লেষণ করুন। Metered billing ব্যবহার করলে আগে token কোথায় খরচ হচ্ছে তা নির্ধারণ করুন, কারণ coding agent-এর token usage মূলত প্রতিটি turn-এ আবার পাঠানো context-এর কারণে হয়, agent যে code লেখে তার কারণে নয়।
বিল নির্ধারণকারী গুণকসমূহ
শিরোনামে দেওয়া হার এই তালিকার সবচেয়ে ছোট বিষয়। নিচের প্রতিটি বিষয় একই স্তরে দুই vendor-এর হারের পার্থক্যের চেয়ে প্রকৃত বিলকে বেশি পরিবর্তন করে।
ক্যাশ করা input। উভয় vendor-ই cache hit-এর জন্য base input-এর 10% চার্জ করে। Anthropic cache লেখার জন্যও চার্জ করে: পাঁচ মিনিটের entry-এর জন্য base input-এর 1.25 গুণ এবং এক ঘণ্টার entry-এর জন্য 2 গুণ। পরে হওয়া hit read price-এ ওই entry-টি refresh করে। তাই পাঁচ মিনিটের entry একটি read-এর পর নিজের খরচ তুলে ফেলে। অনুরোধের মধ্যে দীর্ঘ বিরতি থাকলে workload যতবার read করে, তার চেয়ে বেশি বার write করে। সে ক্ষেত্রে caching সাশ্রয়ের চেয়ে বেশি খরচ করে। স্থির network traffic ভালোভাবে cache হয়। হঠাৎ হঠাৎ হওয়া network traffic হয় না।
Batch discount। উভয় platform-এ input এবং output-এর উপর 50% ছাড় প্রযোজ্য, তবে শুধু asynchronous কাজের জন্য। কাজটি অপেক্ষা করতে পারলে যেকোনো vendor-এ বিল অর্ধেক হয়, এবং এই ছাড় caching-এর সঙ্গে একত্রে প্রযোজ্য।
Output-এর অংশ। Claude output-এর জন্য তার input rate-এর 5 গুণ চার্জ করে। OpenAI চার্জ করে 6 গুণ। আপনার token-এর বেশি অংশ যদি পড়ার বদলে লেখা হয়, সমান input rate-এ Claude তুলনামূলকভাবে সুবিধাজনক। Input-নির্ভর কাজের ক্ষেত্রে বিপরীতটি প্রযোজ্য।
Retry। একটি retry-এর জন্য পুরো input-এর খরচ আবার দিতে হয়, কিন্তু ব্যবহারযোগ্য কিছু ফেরত আসে না। আপনার 6% call schema validation-এ ব্যর্থ হয়ে retry হলে, আপনার পরিকল্পনায় উল্লেখিত পরিমাণের তুলনায় input-এর অংশ 6% বেশি হয়। Retry-কে error line হিসেবে নয়, cost line হিসেবে log করুন। দলগুলো এই গুণকটি সবার শেষে শনাক্ত করে। প্রায়ই vendor-গুলোর পার্থক্যের চেয়েও এটি বড় হয়, যে পার্থক্য নিয়ে তারা এক সপ্তাহ বিতর্ক করেছে।
কোন পক্ষ হারে, এবং কোথায়
Claude ছোট স্তরে সরাসরি হারে। gpt-5.6-luna-এর প্রতি মিলিয়ন ইনপুট টোকেনের দাম 0.2, যেখানে Claude Haiku 4.5-এর দাম 1। আউটপুটের দাম যথাক্রমে 1.2 এবং 5। উচ্চ-পরিমাণের শ্রেণিবিন্যাস এবং সংক্ষিপ্ত এক্সট্র্যাকশনের খরচ Claude-এ প্রায় চার গুণ বেশি।
1 September 2026 থেকে Claude workhorse স্তরে হারে। ওই দিন প্রারম্ভিক হার শেষ হবে এবং Sonnet 5-এর দাম হবে 3 ও 15, যেখানে gpt-5.6-terra-এর দাম অপরিবর্তিত থাকবে। Frontier স্তরে আউটপুটের হারে Claude এগিয়ে, তবে আপনার নিজস্ব টোকেন গণনা এই ব্যবধান মুছে দিতে পারে। August 2026-এ ইনপুট-নির্ভর কাজে কোনো পক্ষই জেতে না, কারণ উভয় পক্ষের প্রতি মিলিয়ন ইনপুটের দাম 2 হওয়ায় ইনপুটের খরচ একই।
আপনার নিজস্ব ট্র্যাফিকে এটি কীভাবে পরিমাপ করবেন
প্রতিটি response-এ usage object পড়ুন এবং প্রতি request-এর জন্য চারটি সংখ্যা সংরক্ষণ করুন: input tokens, output tokens, cache read tokens এবং cache write tokens। Claude API-তে এগুলো যথাক্রমে input_tokens, output_tokens, cache_read_input_tokens এবং cache_creation_input_tokens হিসেবে আসে। প্রতিদিন এগুলোর যোগফল বের করুন, বর্তমান rates দিয়ে গুণ করুন এবং মোট ফল invoice-এর সঙ্গে তুলনা করুন। দুটির মধ্যে পার্থক্য থাকলে তার কারণ সাধারণত retries অথবা এমন কোনো code path, যা আপনি যে release করেছেন তা ভুলে গেছেন।
একটি sample prompt-এর পরিবর্তে বাস্তব traffic-এর এক সপ্তাহের ওপর তুলনাটি চালান। cost per token-এর বদলে cost per completed task তুলনা করুন। যে model একবারের চেষ্টায় উত্তর দেয় এবং তার rate দ্বিগুণ, সেটি এমন model-এর চেয়ে সস্তা, যেটির অর্ধেক rate হলেও তিনটি চেষ্টা প্রয়োজন। Cost per token হলো একটি rate। Cost per completed task হলো আপনার bill।
কোনো কিছু চালু রাখার আগে একটি hard spend ceiling নির্ধারণ করুন। উভয় platform তাদের console-এ spend limits দেয়। Retry loop-এ আটকে থাকা agent এক রাতেই এক মাসের budget খরচ করতে পারে। এটি সব সময় চালু থাকা agent-এর cost control-এর মতো করে সংযুক্ত করুন। নিজের server-এ প্রথম version তৈরি করলে, VPS-এ প্রথম Claude API app এই arithmetic-এর ভিত্তি হিসেবে ব্যবহৃত key handling এবং request loop ব্যাখ্যা করে।
FAQ
Claude API কি ChatGPT API-এর চেয়ে সস্তা?
সব সময় নয়। August 2026-এ উভয় প্ল্যাটফর্মের frontier এবং workhorse tier-এ প্রতি input token-এর মূল্য একই, আর Claude প্রতি output token-এ কম মূল্য নেয়। তাই output-heavy কাজে Claude-এর খরচ কয়েক শতাংশ কম হয়। ছোট tier-এ OpenAI-এর gpt-5.6-luna-এর প্রতি input token-এর মূল্য Claude Haiku 4.5-এর এক-পঞ্চমাংশ। তাই high-volume classification OpenAI-তে অনেক সস্তা। আপনার নিজস্ব token mix ব্যবহার করে হিসাব করুন। কারণ এই সামান্য ব্যবধান আপনার workload-এর ওপর নির্ভর করে, price list-এর ওপর নয়।
একই শব্দ প্রতিটি API-তে ভিন্ন সংখ্যক token হিসেবে গণনা হয় কেন?
কারণ প্রতিটি model-এর নিজস্ব tokenizer আছে, এবং token count model-এর বৈশিষ্ট্য। Anthropic-এর নথি অনুযায়ী, Claude 4.7 এবং পরবর্তী model একই text-এর জন্য Claude Sonnet 4.6 এবং আগের model-এর তুলনায় প্রায় 30% বেশি token তৈরি করে। প্রতিটি vendor-এর token counting endpoint-এ আপনার নিজস্ব text পাঠান। একটি count-কে অন্যটির দ্বারা ভাগ করুন। তুলনা করার আগে প্রকাশিত rate-এ সেই অনুপাত প্রয়োগ করুন। 20% token-এর পার্থক্য অধিকাংশ প্রকাশিত rate-এর পার্থক্যকে ছাড়িয়ে যায়।
Prompt caching কি কখনও bill বাড়িয়ে দিতে পারে?
হ্যাঁ, Anthropic-এ পারে। পাঁচ মিনিটের entry-এর জন্য cache write-এর খরচ base input rate-এর 1.25 গুণ, আর এক ঘণ্টার entry-এর জন্য 2 গুণ। Cache hit-এর খরচ 0.1 গুণ। আপনার traffic এত বেশি bursty হলে যে অধিকাংশ entry পড়ার আগেই expire হয়ে যায়, তাহলে আপনি write premium দেবেন কিন্তু কোনো read পাবেন না। আপনার logs-এ cache_creation_input_tokens এবং cache_read_input_tokens তুলনা করুন। অনুপাত 1-এর কাছাকাছি হলে caching আপনার খরচ বাড়াচ্ছে। তাই entry-এর মেয়াদ বাড়ান অথবা caching বাদ দিন।
আমার কি API-তে coding agent চালানো উচিত, নাকি subscription ব্যবহার করা উচিত?
স্বাভাবিক volume-এ একজন developer-এর জন্য subscription seat সাধারণত metered API billing-এর চেয়ে সস্তা। কারণ coding agent প্রতিটি turn-এ বড় context আবার পাঠায়, এবং প্রতিবার সেই context-এর জন্য খরচ হয়। প্রথমে এক সপ্তাহ এর ব্যবহার মাপুন। তারপর API-এর মোট খরচ seat price-এর সঙ্গে তুলনা করুন। Usage অনিয়মিত হলে API সাশ্রয়ী হতে পারে। এমন programmatic access প্রয়োজন হলেও API সাশ্রয়ী, যা seat প্রদান করে না।