Token milioni 1 katika Claude hugharimu kiasi gani?
Claude hutenganisha bei za token za ingizo na towe. Jifunze hesabu ya kubadilisha token milioni 1 kuwa gharama halisi ya bili yako ya kila mwezi.
Je, token 1M katika Claude ni kiasi gani?
Token 1M inamaanisha token milioni moja, na hiyo ndiyo kipimo kinachotumiwa kutaja bei za kila Claude API (application programming interface). Hakuna bei moja maalum, kwa sababu token za ingizo na token za towe hutozwa kwa viwango tofauti, na kila model ina jozi yake ya viwango. Kufikia Agosti 2026, token milioni moja za ingizo hugharimu $1 kwenye Claude Haiku 4.5, $2 kwenye Claude Sonnet 5, na $5 kwenye Claude Opus 5.
Towe ndilo sehemu ghali zaidi. Kwenye kila model ya sasa, kiwango cha towe ni mara tano ya kiwango cha ingizo. Kwa hiyo, uwiano kati ya viwili hivyo huamua bili yako zaidi kuliko bei kuu iliyoonyeshwa. App inayotuma nyaraka ndefu na kurudisha majibu mafupi huwa na gharama tofauti sana na app inayoandika majibu marefu kutokana na prompt fupi.
Ukurasa huu unaeleza uchumi wa matumizi: token inagharimu kiasi gani na jinsi ya kukadiria bili kabla ya kuunda programu. Ili kujua token hutumika wapi wakati unafanya kazi, soma token hutumika wapi ndani ya session ya Claude Code.
1M tokens inaonekanaje
Token ni kipande cha maandishi ambacho model husoma au kuandika. Mwongozo wa makadirio wa Anthropic ni token moja kwa kila herufi 4, au takriban maneno 0.75 ya Kiingereza. Kwa hiyo, tokens milioni moja ni takriban maneno 750,000, au karibu 4 MB za maandishi yasiyopangiliwa.
Makadirio yaliyochapishwa ya pembejeo za kawaida yanaonyesha vizuri zaidi ukubwa huo.
The data behind this chart
[
{
"label": "Average web page (10 kB)",
"tokens": "2,500"
},
{
"label": "Documentation page (100 kB)",
"tokens": "25,000"
},
{
"label": "Research paper PDF (500 kB)",
"tokens": "125,000"
}
]Kwa viwango hivyo, tokens 1M ni takriban kurasa 400 za wastani za wavuti zinazosomwa mara moja, au karatasi nane za utafiti zenye ukubwa huo. Ni kusoma codebase ya ukubwa wa kati mara moja, au mwezi mmoja wa matumizi mepesi ya chat kwa mtu mmoja.
Chukulia yote hayo kuwa makadirio. Code, JSON na maandishi katika lugha nyingine zisizo Kiingereza hujumuisha maneno machache zaidi ndani ya token moja, kwa hiyo uwiano wa 0.75 ni upande wa juu wa makadirio. Kuna jambo lingine linalobadilisha hesabu: Claude Opus 4.7 na matoleo ya baadaye, yanayojumuisha Opus 5 na Sonnet 5, hutumia tokenizer mpya zaidi inayozalisha takriban tokens 30 percent zaidi kwa maandishi yale yale kuliko Sonnet 4.6 na matoleo ya awali. Claude Haiku 4.5 hutumia tokenizer ya zamani. Kwa hiyo, hesabu uliyopima kwenye Haiku 4.5 itakuwa ndogo kuliko hesabu kwenye Sonnet 5 kwa pembejeo ile ile. Hii inamaanisha kuwa kulinganisha moja kwa moja bei kwa tokens milioni 1 kwenye mipaka hiyo si sahihi. Hesabu prompt ile ile dhidi ya models zote mbili kabla ya kufanya uamuzi.
Claude hutoza kiasi gani kwa kila token milioni
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5
},
{
"label": "Sonnet 5 (to 31 Aug 2026)",
"input_usd": 2,
"output_usd": 10
},
{
"label": "Sonnet 5 (from 1 Sep 2026)",
"input_usd": 3,
"output_usd": 15
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25
}
]Claude Sonnet 5 ina bei ya utangulizi ya $2 kwa input na $10 kwa output hadi 31 Agosti 2026. Kuanzia 1 Septemba 2026, kiwango cha kawaida kitatumika: $3 kwa input na $15 kwa output. Claude Opus 5 ina bei ya $5 kwa input na $25 kwa output.
Viwango vinaweza kubadilika. Chukulia kila takwimu kwenye ukurasa huu kuwa mfano wa hesabu wa Agosti 2026, kisha thibitisha nambari za sasa kwenye ukurasa rasmi wa bei kabla ya kuidhinisha bajeti.
Urefu wa context haubadilishi kiwango cha bei. Kwenye Claude 4.6 na matoleo ya baadaye, context window kamili ya token 1M hutozwa kwa bei ya kawaida. Kwa hiyo, ombi lenye token 900,000 hugharimu kiasi kilekile kwa kila token kama ombi lenye token 9,000. Prompt ndefu hugharimu zaidi kwa sababu ina token nyingi zaidi, na hakuna kiwango tofauti cha long-context.
Hesabu inayobaki sahihi baada ya bei kubadilika
Kila bili ina kuzidisha mara mbili na kujumlisha mara moja.
cost = (input_tokens / 1,000,000) * input_rate
+ (output_tokens / 1,000,000) * output_rateImeandikwa kama code unayoweza kuendesha:
INPUT_RATE = 2.00 # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00 # USD per million output tokens
def cost(input_tokens, output_tokens):
return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000
print(f"{cost(4300, 400):.4f}")Hiyo inachapisha 0.0126. Ombi linalotuma tokeni 4,300 za input na kupokea tokeni 400 za output hugharimu takriban senti 1.3 kwenye Sonnet 5. Weka viwango hivyo viwili mahali pamoja kwenye code yako. Bei ikibadilika, unahariri mistari miwili, na kila makadirio kwenye mfumo wako husasishwa pamoja nayo.
Makadirio yaliyokamilishwa kwa programu halisi
Chukua msaidizi wa usaidizi. System prompt yake pamoja na nyaraka za bidhaa zinafikia tokens 4,000, na hutumwa katika kila ombi moja moja kwa sababu Messages API haina hali ya kudumu na model haikumbuki chochote kati ya miito. Swali la mtumiaji huongeza takribani tokens 300. Jibu huwa na takribani tokens 400. Hivyo, kila ombi lina tokens 4,300 za input na tokens 400 za output.
Tokens milioni 1 za input zinatosha kwa takribani maombi 232 ya aina hiyo. Kwa maombi 1,000 kwa siku, programu hutumia tokens milioni 4.3 za input kila siku, kwa hiyo “tokens 1M” ni chini ya saa 6 za traffic.
The data behind this chart
[
{
"label": "Opus 5, list rates",
"cost_per_1k_usd": "31.50"
},
{
"label": "Sonnet 5, list rates",
"cost_per_1k_usd": "12.60"
},
{
"label": "Sonnet 5, Batch API",
"cost_per_1k_usd": "6.30"
},
{
"label": "Haiku 4.5, list rates",
"cost_per_1k_usd": "6.30"
},
{
"label": "Sonnet 5, warm prompt cache",
"cost_per_1k_usd": "5.40"
}
]Kwenye Claude Opus 5, traffic hiyo hugharimu $31.50 kwa maombi 1,000. Kwenye Sonnet 5, hugharimu $12.60. Kushuka hadi Claude Haiku 4.5 hupunguza gharama hadi $6.30, na prompt cache iliyo tayari kutumika kwenye Sonnet 5 hupunguza zaidi hadi $5.40.
Zidisha kwa 30 ili kupata gharama ya mwezi mmoja yenye traffic hiyo. Sonnet 5 kwa viwango vilivyochapishwa hugharimu takribani $378 kwa mwezi. Programu hiyo hiyo ikiwa na cache iliyo tayari kutumika hugharimu takribani $162. Chaguo la model na uamuzi wako wa kutumia caching kila kimoja kina thamani kubwa kuliko punguzo lolote la bei utakalojadili kwa kiwango hiki. Model ya kutumia ni suala tofauti, na model ya bei ya chini zaidi inayofaulu kwenye evaluations zako ndiyo inayofaa: kuchagua kati ya Opus, Sonnet na Haiku inaeleza jinsi ya kuijaribu ipasavyo.
Prompt caching hupunguza sehemu inayojirudia
Kiambishi awali cha token 4,000 kinafanana kwenye kila ombi, na unalipia bei kamili ya input kwa sehemu hiyo kila wakati. Prompt caching huhifadhi kiambishi awali kilichochakatwa na hutoza kiwango kilichopunguzwa kinapotumika tena.
Kusoma kutoka kwenye cache hugharimu mara 0.1 ya kiwango cha msingi cha input. Kuandika kwenye cache hugharimu mara 1.25 ya kiwango cha msingi kwa muda wa kuhifadhi wa dakika 5, au mara 2 ya kiwango cha msingi kwa muda wa saa 1. Kwa hiyo, cache ya dakika 5 huanza kuleta faida baada ya usomaji mmoja, kwa sababu uandishi hugharimu 0.25 zaidi huku kila usomaji ukiokoa 0.9. Cache ya saa 1 inahitaji usomaji 2 ili kufidia gharama yake.
Njia rahisi zaidi ya kuiwasha ni kuweka field moja ya kiwango cha juu:
curl https://api.anthropic.com/v1/messages \
-H "content-type: application/json" \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"max_tokens": 1024,
"cache_control": {"type": "ephemeral"},
"system": "You are a helpful assistant.",
"messages": [
{"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
]
}'Kisha soma block ya usage inayorejeshwa:
{
"usage": {
"cache_creation_input_tokens": 5120,
"cache_read_input_tokens": 1800,
"input_tokens": 50,
"output_tokens": 503
}
}Vihesabu hivyo 3 vya input hutozwa kwa viwango 3 tofauti, na jumla yake ndiyo ujazo wako halisi wa input: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens. Makadirio ya gharama yanayosoma input_tokens pekee yatakuwa na makosa makubwa baada ya caching kuwashwa.
Mambo 2 huzuia cache kuleta faida, na yote mawili hushindwa bila kutoa error.
Kiambishi awali lazima kifanane byte kwa byte. Cache lookup hulinganisha kiambishi awali, kwa hiyo timestamp au jina la mtumiaji mwanzoni mwa system prompt hubadilisha kiambishi hicho kwenye kila ombi. Hivyo utalipa mara 1.25 ya kiwango cha msingi cha input kila wakati na hutawahi kusoma kutoka kwenye cache. Dalili ni cache_creation_input_tokens kubaki juu huku cache_read_input_tokens ikibaki 0. Weka cache_control kwenye block ya mwisho ambayo maudhui yake yanafanana katika maombi yote, kisha weka kila kitu kinachobadilika baada yake. Kubadilisha ufafanuzi wako wa tools hubatilisha cache yote iliyo chini yake, kwa sababu invalidation hufuata mpangilio wa tools, kisha system, halafu messages.
Kiambishi awali lazima kiwe kirefu vya kutosha. Urefu wa chini unaoweza kuwekwa kwenye cache ni token 512 kwenye Opus 5, token 1,024 kwenye Sonnet 5 na token 4,096 kwenye Haiku 4.5. Prompt fupi zaidi haiwekwi kwenye cache na hakuna error inayorejeshwa. Kiambishi awali cha token 4,000 katika mfano hapo juu kinawekwa kwenye cache kwenye Sonnet 5, lakini hakiwekwi kwenye cache kwenye Haiku 4.5, kwa sababu 4,000 iko chini ya kiwango cha chini cha model hiyo. Vihesabu vyote viwili vikisoma 0, hakuna kitu kilichowekwa kwenye cache.
Uchakataji wa kundi hupunguza kiwango kwa nusu
Batch API huchakata maombi kwa njia isiyosawazisha kwa punguzo la asilimia 50 kwenye ingizo na towe. Katika mfano ulio hapo juu, hii hubadilisha $12.60 kwa kila maombi 1,000 kuwa $6.30. Punguzo hili linaweza kutumika pamoja na prompt caching, kwa hiyo batch job iliyo na data iliyohifadhiwa kwenye cache ndiyo njia ya gharama ya chini zaidi ya kuendesha kazi nyingi.
Unachopoteza ni muda wa kusubiri. Hivyo, batch haifai kwa kazi ambayo mtu anasubiri matokeo yake. Inafaa kwa uainishaji wa usiku na kujaza upya nyaraka.
Kwa nini gharama ya chat huongezeka ndani ya mazungumzo moja
Kwa sababu API haihifadhi state, client yako hutuma tena mazungumzo yote katika kila turn. Kwa hiyo, matumizi ya tokens ndani ya chat huongezeka kwa uwiano wa mraba wa urefu wake, si kwa mstari wa moja kwa moja.
Chukulia turns zenye wastani wa tokens 500. Turn 1 hutuma input tokens 500. Turn 2 hutuma 1,000. Turn 20 hutuma 10,000. Ukijumlisha kwa kutumia n(n+1)/2, mazungumzo ya turns 20 yatakuwa yametuma takribani input tokens 105,000, ingawa transcript yenyewe ina urefu wa tokens 10,000 pekee.
Ndiyo maana feature ya chat hugharimu zaidi kuliko transcript yake inavyoonyesha, na kwa nini kuweka cache kwenye stable prefix au kufupisha turns za zamani hulipa gharama yake katika threads ndefu. Agent inayozunguka kupitia tool calls ina muundo huo huo, na huwa mbaya zaidi: kila tool result hubaki kwenye history na hutumwa tena katika kila turn inayofuata. Kuweka kikomo madhubuti cha matumizi kwa agent unayoiendesha mwenyewe ni muhimu zaidi hapa, kwa sababu ongezeko hilo hutokea kiotomatiki na hakuna anayelifuatilia.
Hesabu tokeni kabla ya kubahatisha
Acha kukadiria idadi ya tokeni kwa kutumia idadi ya maneno. API hukuhesabia tokeni hizo bila malipo, kwa kutumia rate limit iliyo tofauti na ile ya kuunda ujumbe.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{
"role": "user",
"content": "Hello, Claude"
}]
}'Jibu lina field moja:
{ "input_tokens": 14 }Ipe system prompt yako halisi na tool definitions, pamoja na user message inayowakilisha matumizi halisi, kisha weka nambari hiyo kwenye cost function iliyo hapo juu. Endpoint hutumia body ile ile inayotumiwa na message request, kwa hiyo images na PDFs huhesabiwa kwa usahihi pia. Kuna mambo mawili ya kuzingatia. Hesabu hiyo ni estimate na inaweza kutofautiana kidogo na kiasi kinachotozwa. Pia hupimwa kwa tokenizer ya model unayopitisha, kwa hiyo pitisha model utakayoendesha kwa kweli.
Output tokens haziwezi kuhesabiwa mapema, kwa sababu bado hazipo. Ziweke kikomo kwa max_tokens, kisha pima distribution halisi kutoka usage.output_tokens kwenye live traffic.
Ni mambo gani mengine huongeza gharama
Tokens ndizo sehemu kubwa ya bili. Kuna gharama chache ambazo si tokens, na mara nyingi huwashangaza watu.
- Ufafanuzi wa tools huwa input tokens katika kila ombi. System prompt ya kutumia tools pekee huongeza tokens 286 hadi 406 kwenye Opus 5, kabla ya schemas zako mwenyewe. Ufafanuzi 10 mirefu wa tools unaweza kuongeza maradufu prompt ndogo.
- Utafutaji wa wavuti hutozwa $10 kwa kila utafutaji 1,000, pamoja na tokens zinazotumiwa na matokeo yanapoingizwa kwenye context.
- Web fetch haina ada yake, lakini ukurasa uliopatikana huwa input tokens. Ukurasa wa documentation wa 100 kB huwa na takribani 25,000 kati ya hizo.
- Kuomba inference ya US pekee kwa
inference_geokwenye Claude 4.6 na matoleo ya baadaye huweka multiplier ya 1.1 kwenye kila aina ya token, pamoja na cache reads na cache writes.
Ikiwa API ndiyo chaguo sahihi la kununua inategemea kiasi cha matumizi yako. Chini ya kiwango fulani cha matumizi, mpango wa kila mwezi wenye ada ya kudumu huwa bora moja kwa moja, na API ikilinganishwa na usajili wa Claude hufanya ulinganisho huo kwa kutumia nambari halisi.
FAQ
Je, tokens 1M hugharimu kiasi gani katika Claude?
Inategemea modeli na ikiwa tokens ni za ingizo au za towe. Kufikia Agosti 2026, tokens za ingizo milioni moja hugharimu $1 kwenye Claude Haiku 4.5, $2 kwenye Claude Sonnet 5 kwa bei ya utangulizi, na $5 kwenye Claude Opus 5. Gharama ya towe ni mara tano ya kiwango cha ingizo kwenye kila modeli hiyo. Kuanzia 1 Septemba 2026, Sonnet 5 itatoza $3 kwa ingizo na $15 kwa towe. Viwango hubadilika, kwa hiyo vithibitishe kwenye ukurasa rasmi wa bei kabla ya kuweka kiasi kwenye bajeti.
Je, tokens 1M ni sawa na maneno 1M?
Hapana. Token moja huwa na takribani herufi 4 za Kiingereza, au karibu maneno 0.75, kwa hiyo tokens milioni moja ni takribani maneno 750,000. Uwiano huo ni mwongozo tu. Code, JSON na lugha nyingine zisizo Kiingereza hutumia tokens nyingi zaidi kwa kila neno. Claude Opus 4.7 na matoleo ya baadaye pia hutumia tokenizer mpya inayozalisha takribani tokens zaidi kwa asilimia 30 kwa maandishi yaleyale kuliko Claude Sonnet 4.6 na matoleo ya awali, kwa hiyo hesabu hizo haziwezi kuhamishwa moja kwa moja kati ya vizazi vya modeli. Pima kwa kutumia endpoint ya bure ya /v1/messages/count_tokens, ukipitisha modeli unayopanga kuendesha.
Je, prompt caching huokoa pesa kila wakati?
Hapana. Kuandika cache ya dakika 5 hugharimu mara 1.25 ya kiwango cha msingi cha ingizo, kwa hiyo prefix iliyoandikwa lakini haisomwi kamwe hugharimu asilimia 25 zaidi kuliko kuituma bila cache. Inajilipa kuanzia usomaji wa kwanza. Hushindwa kwa njia mbili, na kushindwa huko hakutoi ujumbe. Ikiwa prefix iliyowekwa kwenye cache inabadilika kati ya maombi, utafutaji haulingani kamwe kwa sababu ulinganishaji huo hutumia prefix kamili. Ikiwa prefix ni fupi kuliko urefu wa chini unaokubalika kwa cache, ambao ni tokens 1,024 kwenye Sonnet 5 na 4,096 kwenye Haiku 4.5, hakuna kinachowekwa kwenye cache na hakuna kosa linalorudishwa. Wakati cache_creation_input_tokens na cache_read_input_tokens zote zinasoma 0, cache haifanyi chochote.
Kwa nini bili yangu ilikua haraka kuliko idadi ya ujumbe?
Kwa sababu mazungumzo yote hutumwa tena katika kila zamu. Messages API haihifadhi hali, kwa hiyo zamu ya 20 ya mazungumzo hubeba tena zamu zote 19 za awali kama ingizo. Kwa wastani wa tokens 500 kwa kila zamu, mazungumzo ya zamu 20 hutuma takribani tokens 105,000 za ingizo, ingawa transcript ina urefu wa tokens 10,000 tu. Agent loops hufanya kazi vivyo hivyo kwa sababu kila matokeo ya tool hubaki kwenye historia. Weka prefix thabiti kwenye cache, au fanya muhtasari wa zamu za zamani na uziondoe kwenye ombi.