Gharama ya token milioni 1 kwenye Claude ni kiasi gani?
Claude hutoza bei tofauti kwa input na output kulingana na model unayotumia. Jifunze jinsi ya kukokotoa bili yako kwa kutumia viwango vya sasa vya Haiku, Sonnet, na Opus.
Token 1M katika Claude hugharimu kiasi gani?
Token 1M inamaanisha token milioni moja, na ndiyo kipimo kinachotumika katika kila bei ya API (application programming interface) ya Claude. Hakuna bei moja ya jumla kwa sababu input na output hutoza viwango tofauti, na kila model ina viwango vyake. Kufikia Agosti 2026, token milioni moja za input hugharimu $1 kwenye Claude Haiku 4.5, $2 kwenye Claude Sonnet 5, na $5 kwenye Claude Opus 5.
Output ndiyo sehemu ya gharama kubwa. Katika kila model ya sasa, kiwango cha output ni mara tano ya kiwango cha input, kwa hivyo uwiano kati ya hizi mbili ndio huamua bili yako zaidi kuliko takwimu ya msingi. Programu inayotuma hati ndefu na kurudisha majibu mafupi hufanya kazi kwa njia tofauti sana na ile inayoandika majibu marefu kutoka kwa prompt fupi.
Ukurasa huu unahusu uchumi wa vitengo: gharama ya token, na jinsi ya kukadiria bili kabla ya kuanza kujenga. Kwa maelezo kuhusu mahali ambapo token huenda unapoendelea kufanya kazi, soma mahali ambapo token huenda ndani ya session ya Claude Code.
Muonekano wa token 1M
Token ni sehemu ya maandishi ambayo modeli inaisoma au kuiandika. Mwongozo wa jumla wa Anthropic ni token moja kwa kila herufi 4, au takriban maneno 0.75 ya Kiingereza. Kwa hivyo, token milioni moja ni takriban maneno 750,000, au karibu 4 MB ya maandishi ya kawaida.
Makadirio yaliyochapishwa kwa maingizo ya kawaida yanatoa picha bora ya ukubwa huu.
The data behind this chart
[
{
"label": "Average web page (10 kB)",
"tokens": "2,500"
},
{
"label": "Documentation page (100 kB)",
"tokens": "25,000"
},
{
"label": "Research paper PDF (500 kB)",
"tokens": "125,000"
}
]Kwa viwango hivyo, token 1M ni takriban kurasa 400 za wavuti zilizosomwa mara moja, au karatasi nane za utafiti za ukubwa huo. Ni sawa na kupitia codebase ya ukubwa wa wastani mara moja, au mwezi mmoja wa matumizi madogo ya chat kwa mtu mmoja.
Chukulia hayo yote kama makadirio. Code, JSON, na maandishi katika lugha nyingine isipokuwa Kiingereza hupakia maneno machache zaidi ndani ya token moja, kwa hivyo uwiano wa 0.75 ni makadirio ya matumaini zaidi. Jambo lingine hubadilisha hesabu: Claude Opus 4.7 na matoleo mapya zaidi, ambayo yanajumuisha Opus 5 na Sonnet 5, yanatumia tokenizer mpya inayozalisha takriban asilimia 30 ya token nyingi zaidi kwa maandishi yaleyale kuliko Sonnet 4.6 na matoleo ya awali. Claude Haiku 4.5 inatumia tokenizer ya zamani. Kwa hivyo, hesabu uliyopima kwenye Haiku 4.5 itakuwa ndogo kuliko hesabu kwenye Sonnet 5 kwa ingizo linalofanana, jambo ambalo linamaanisha kulinganisha bei ya moja kwa moja kwa kila milioni katika mpaka huo si haki. Hesabu prompt ileile kwenye modeli zote mbili kabla ya kufanya uamuzi.
Gharama za Claude kwa kila token milioni moja
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5
},
{
"label": "Sonnet 5 (to 31 Aug 2026)",
"input_usd": 2,
"output_usd": 10
},
{
"label": "Sonnet 5 (from 1 Sep 2026)",
"input_usd": 3,
"output_usd": 15
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25
}
]Claude Sonnet 5 inatumia bei ya utangulizi ya $2 kwa input na $10 kwa output hadi tarehe 31 Agosti 2026. Kuanzia tarehe 1 Septemba 2026, bei ya kawaida itaanza kutumika: $3 kwa input na $15 kwa output. Claude Opus 5 inagharimu $5 na $25. Kuna modeli moja iliyo juu ya chati hiyo: Claude Fable 5 imeorodheshwa kwa $10 kwa input na $50 kwa output, kwa hivyo kama viwango hivyo vinafaa kulipwa inategemea kazi unayoiagiza ifanye.
Bei hubadilika. Chukulia kila namba kwenye ukurasa huu kama mfano wa hesabu wa Agosti 2026, na uthibitishe namba za sasa kwenye ukurasa rasmi wa bei kabla ya kuidhinisha bajeti.
Viwango hivi vinaonyesha gharama za Claude lakini havionyeshi kama ndiyo chaguo nafuu zaidi kwa kazi yako, na kazi tatu zilizopigiwa hesabu kwenye Claude na ChatGPT zinaonyesha ni API ipi inayofaa zaidi kwa kila hali.
Kitu kimoja ambacho hakibadilishi kiwango cha bei ni urefu wa context. Kwenye Claude 4.6 na matoleo mapya zaidi, dirisha zima la context la 1M token hutoza bei ya kawaida, kwa hivyo ombi la token 900,000 linagharimu kiasi kilekile kwa kila token kama ombi la token 9,000. Prompt ndefu inagharimu zaidi kwa sababu ina token nyingi zaidi, na hakuna kiwango tofauti cha bei kwa ajili ya context ndefu.
Hesabu inayobaki baada ya mabadiliko ya bei
Kila ankara inajumuisha kuzidisha mara mbili na kujumlisha mara moja.
cost = (input_tokens / 1,000,000) * input_rate
+ (output_tokens / 1,000,000) * output_rateImeandikwa kama msimbo unaoweza kuutumia:
INPUT_RATE = 2.00 # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00 # USD per million output tokens
def cost(input_tokens, output_tokens):
return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000
print(f"{cost(4300, 400):.4f}")Hiyo huchapisha 0.0126. Ombi linalotuma token 4,300 za ingizo na kupokea token 400 za pato hugharimu takriban senti 1.3 kwenye Sonnet 5. Weka viwango hivyo viwili sehemu moja kwenye msimbo wako. Bei ikibadilika, unahariri mistari miwili, na kila makadirio katika mfumo wako yatafanyiwa marekebisho kulingana na bei hiyo mpya.
Makadirio yaliyofanyiwa kazi kwa programu halisi
Chukua msaidizi wa usaidizi (support assistant). Prompt yake ya mfumo na nyaraka za bidhaa hufikia token 4,000, na hutumwa katika kila ombi, kwa sababu Messages API haina hali (stateless) na modeli haikumbuki chochote kati ya wito mmoja na mwingine. Swali la mtumiaji huongeza takriban token 300. Jibu huchukua takriban 400. Hiyo ni token 4,300 za kuingiza na 400 za kutoa kwa kila ombi.
Token milioni moja za kuingiza hununua takriban maombi 232 ya umbo hilo. Kwa maombi 1,000 kwa siku, programu hutumia token milioni 4.3 za kuingiza kila siku, kwa hivyo "token 1M" ni chini ya saa sita za trafiki.
The data behind this chart
[
{
"label": "Opus 5, list rates",
"cost_per_1k_usd": "31.50"
},
{
"label": "Sonnet 5, list rates",
"cost_per_1k_usd": "12.60"
},
{
"label": "Sonnet 5, Batch API",
"cost_per_1k_usd": "6.30"
},
{
"label": "Haiku 4.5, list rates",
"cost_per_1k_usd": "6.30"
},
{
"label": "Sonnet 5, warm prompt cache",
"cost_per_1k_usd": "5.40"
}
]Kwenye Claude Opus 5 trafiki hiyo hugharimu $31.50 kwa kila maombi 1,000. Kwenye Sonnet 5 ni $12.60. Kushuka hadi Claude Haiku 4.5 huileta hadi $6.30, na cache ya prompt yenye joto kwenye Sonnet 5 hushuka zaidi hadi $5.40.
Zidisha kwa 30 kwa mwezi wa trafiki hiyo. Sonnet 5 kwa viwango vya orodha ni takriban $378 kwa mwezi. Programu hiyo hiyo yenye cache yenye joto ni takriban $162. Chaguo lako la modeli na uamuzi wako wa kuweka cache kila moja ina thamani zaidi kuliko kiwango chochote utakachojadiliana kwa kiasi hiki. Ni modeli ipi ya kuendesha ni swali lake lenyewe, na ile ya bei nafuu zaidi inayopita tathmini zako ndiyo inayoshinda: kuchagua kati ya Opus, Sonnet na Haiku inashughulikia jinsi ya kupima hilo ipasavyo.
Prompt caching inapunguza sehemu inayojirudia
Kiambishi awali cha token 4,000 ni sawa katika kila ombi, na unalipia gharama kamili ya ingizo kila wakati. Prompt caching huhifadhi kiambishi awali kilichochakatwa na kutoza kiwango kilichopunguzwa ili kukitumia tena.
Usomaji wa cache hugharimu mara 0.1 ya kiwango cha msingi cha ingizo. Uandikaji wa cache hugharimu mara 1.25 ya msingi kwa muda wa maisha wa dakika 5, au mara 2 ya msingi kwa muda wa maisha wa saa 1. Kwa hivyo, cache ya dakika 5 hujilipia baada ya usomaji mmoja, kwa sababu uandikaji hugharimu ziada ya 0.25 wakati kila usomaji huokoa 0.9. Cache ya saa 1 inahitaji usomaji miwili ili kufidia gharama.
Njia rahisi zaidi ya kuiwasha ni kutumia sehemu moja ya ngazi ya juu:
curl https://api.anthropic.com/v1/messages \
-H "content-type: application/json" \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"max_tokens": 1024,
"cache_control": {"type": "ephemeral"},
"system": "You are a helpful assistant.",
"messages": [
{"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
]
}'Kisha soma kizuizi cha usage kinachorejeshwa:
{
"usage": {
"cache_creation_input_tokens": 5120,
"cache_read_input_tokens": 1800,
"input_tokens": 50,
"output_tokens": 503
}
}Vihesabio vitatu vya ingizo hutoziwa kwa viwango vitatu tofauti na jumla yake ni kiasi chako halisi cha ingizo: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens. Makadirio ya gharama yanayosoma input_tokens pekee yatakuwa na makosa makubwa mara tu caching itakapowashwa.
Mambo mawili huzuia cache isilete faida, na yote mawili hushindwa kimya kimya.
Kiambishi awali lazima kiwe sawa kwa kila byte. Utafutaji wa cache ni ulinganishaji wa kiambishi awali, kwa hivyo timestamp au jina la mtumiaji lililo juu ya system prompt yako hulibadilisha katika kila ombi. Kisha unalipia mara 1.25 ya ingizo la msingi kila wakati na hutasoma hata mara moja. Dalili yake ni cache_creation_input_tokens kubaki juu wakati cache_read_input_tokens inabaki 0. Weka cache_control kwenye kizuizi cha mwisho ambacho maudhui yake ni sawa katika maombi yote, na uweke kila kitu kinachobadilika baada yake. Kubadilisha ufafanuzi wako wa tools hufuta cache nzima iliyo chini yake, kwa sababu ufutaji hufuata mpangilio wa tools, kisha system, kisha messages.
Kiambishi awali lazima kiwe na urefu wa kutosha. Urefu wa chini kabisa unaoweza kuhifadhiwa ni token 512 kwenye Opus 5, 1,024 kwenye Sonnet 5 na 4,096 kwenye Haiku 4.5. Prompt fupi haihifadhiwi na hakuna kosa linalorejeshwa. Kiambishi awali cha token 4,000 katika mfano hapo juu huhifadhiwa kwenye Sonnet 5 na hakihifadhiwi kwenye Haiku 4.5, kwa sababu 4,000 iko chini ya kiwango cha chini cha mfano huo. Vihesabio vyote viwili vinaposoma 0, hakuna kilichohifadhiwa.
Uchakataji wa bechi hupunguza gharama kwa nusu
Batch API huchakata maombi kwa njia ya asynchronous kwa punguzo la asilimia 50 kwenye gharama za input na output. Katika mfano hapo juu, hii inabadilisha $12.60 kwa kila maombi 1,000 kuwa $6.30. Punguzo hili huongezeka pamoja na prompt caching, hivyo kazi ya bechi iliyohifadhiwa kwenye cache ndiyo njia ya bei nafuu zaidi ya kufanya kazi kwa wingi.
Unachopoteza ni latency, jambo linalofanya bechi kutofaa kwa chochote ambacho mtumiaji anasubiri kukamilika. Inafaa zaidi kwa uainishaji wa usiku kucha na usasishaji wa nyaraka za nyuma (backfills).
Kwa nini gharama za gumzo huongezeka ndani ya mazungumzo moja
Kwa sababu API haina hali (stateless), mteja wako hutuma tena mazungumzo yote katika kila hatua. Matumizi ya tokeni ndani ya gumzo moja kwa hivyo hukua kwa mraba wa urefu wake, si kwa mstari ulionyooka.
Chukua hatua zenye wastani wa tokeni 500. Hatua ya 1 hutuma tokeni 500 za kuingiza. Hatua ya 2 hutuma 1,000. Hatua ya 20 hutuma 10,000. Jumlisha hiyo kwa n(n+1)/2 na mazungumzo ya hatua 20 yatakuwa yametuma takriban tokeni 105,000 za kuingiza, wakati nakala ya mazungumzo yenyewe ina urefu wa tokeni 10,000 pekee.
Hiyo ndiyo sababu kipengele cha gumzo hugharimu zaidi ya inavyoonekana kwenye nakala yake, na kwa nini kuhifadhi (caching) kiambishi awali kisichobadilika au kufupisha hatua za awali hulipa gharama zake kwenye nyuzi ndefu za mazungumzo. Wakala anayezunguka kwenye miito ya zana (tool calls) ana umbo sawa, na mbaya zaidi: kila matokeo ya zana hubaki kwenye historia na hutumwa tena katika kila hatua inayofuata. Kuweka kikomo kikali cha matumizi kwa wakala unayejiendeshea mwenyewe ni muhimu zaidi hapa, kwa sababu ukuaji huo ni wa kiotomatiki na hakuna anayeufuatilia.
Hesabu tokeni kabla ya kukisia
Acha kukadiria idadi ya tokeni kwa kutumia idadi ya maneno. API hukuhesabia tokeni hizo, bila malipo, kwenye kikomo cha matumizi (rate limit) kilichotengwa na kile cha kutengeneza ujumbe.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{
"role": "user",
"content": "Hello, Claude"
}]
}'Jibu lina sehemu moja:
{ "input_tokens": 14 }Ipe API hiyo prompt yako halisi ya mfumo na ufafanuzi wa zana (tool definitions), pamoja na ujumbe wa mwakilishi kutoka kwa mtumiaji, kisha weka namba hiyo kwenye kanuni ya gharama hapo juu. Endpoint hiyo inakubali mwili (body) uleule wa ombi la ujumbe, kwa hivyo picha na faili za PDF huhesabiwa kwa usahihi pia. Kuna tahadhari mbili za kuzingatia. Hesabu hiyo ni makadirio na inaweza kutofautiana kidogo na kiasi kitakachotozwa. Pia, inapimwa kwa kutumia tokenizer ya modeli unayopitisha, kwa hivyo pitisha modeli ambayo utaitumia kihalisi.
Tokeni za pato (output tokens) haziwezi kuhesabiwa mapema, kwa sababu bado hazijatengenezwa. Ziwekee kikomo kwa kutumia max_tokens, kisha pima usambazaji halisi kutoka kwa usage.output_tokens kwenye trafiki ya moja kwa moja.
Vitu vingine vinavyoongezeka kwenye bili
Tokens ndizo sehemu kubwa ya bili. Kuna vitu vichache ambavyo si tokens, na hivi huwashangaza watu.
- Ufafanuzi wa zana (tool definitions) huwa input tokens katika kila ombi. Mfumo wa prompt wa matumizi ya zana pekee huongeza tokens 286 hadi 406 kwenye Opus 5, kabla ya kuhesabu schemas zako mwenyewe. Ufafanuzi kumi wa zana wenye maneno mengi unaweza kuongeza mara mbili ya ukubwa wa prompt ndogo.
- Web search hutozwa $10 kwa kila utafutaji 1,000, juu ya tokens ambazo matokeo hayo hutumia yanapoingia kwenye context.
- Web fetch haina ada ya ziada, lakini ukurasa uliopakuliwa huwa input tokens. Ukurasa wa nyaraka wa 100 kB ni takriban 25,000 za tokens hizo.
- Kuomba inference ya Marekani pekee (US-only) kwa kutumia
inference_geokwenye Claude 4.6 na matoleo mapya zaidi hutumia kizidishi cha 1.1 kwa kila aina ya token, ikijumuisha usomaji na uandikaji wa cache.
Kama API ndiyo chaguo sahihi la kununua inategemea na kiasi chako cha matumizi. Kufikia kikomo cha matumizi kwenye mpango fulani ndiko kwa kawaida huanzisha swali hilo, na njia za kutoka kwenye kikomo huanzia kusubiri muda wa matumizi uishe hadi kuhamishia kazi hiyo kwenye API calls zinazotozwa kwa matumizi. Chini ya kiwango fulani cha matumizi, mpango wa bei isiyobadilika (flat monthly plan) ni bora zaidi, na API ikilinganishwa na usajili wa Claude hufanya ulinganifu huo kwa kutumia namba halisi.
FAQ
Je, token 1M zinagharimu kiasi gani kwenye Claude?
Gharama hutegemea mfano (model) unaotumika, na kama token hizo ni za kuingiza (input) au kutoa (output). Kufikia Agosti 2026, token milioni moja za kuingiza zinagharimu $1 kwenye Claude Haiku 4.5, $2 kwenye Claude Sonnet 5 chini ya bei ya utangulizi, na $5 kwenye Claude Opus 5. Gharama za kutoa ni mara tano ya kiwango cha kuingiza kwa kila mfano kati ya hiyo. Sonnet 5 itabadilika na kuwa $3 kwa kuingiza na $15 kwa kutoa kuanzia tarehe 1 Septemba 2026. Viwango hubadilika, kwa hivyo hakikisha umethibitisha kwenye ukurasa rasmi wa bei kabla ya kupanga bajeti.
Je, token 1M ni sawa na maneno 1M?
Hapana. Token moja ni takriban herufi 4 za Kiingereza, au karibu maneno 0.75, kwa hivyo token milioni moja ni takriban maneno 750,000. Uwiano huo ni mwongozo tu. Nambari za programu (code), JSON na lugha nyingine zisizo za Kiingereza hutumia token nyingi zaidi kwa kila neno. Claude Opus 4.7 na matoleo mapya zaidi pia hutumia tokenizer mpya inayozalisha takriban asilimia 30 ya token nyingi zaidi kwa maandishi yaleyale ikilinganishwa na Claude Sonnet 4.6 na matoleo ya awali, kwa hivyo idadi ya token haiwezi kulinganishwa kati ya vizazi tofauti vya mifano. Pima kwa kutumia endpoint ya bure ya /v1/messages/count_tokens, kwa kupitisha mfano unaopanga kuutumia.
Je, prompt caching huokoa pesa kila wakati?
Hapana. Uandishi wa cache wa dakika 5 unagharimu mara 1.25 ya kiwango cha msingi cha kuingiza, kwa hivyo kiambishi awali (prefix) kinachoandikwa na kutokusomwa kamwe hugharimu asilimia 25 zaidi kuliko kukituma kama maandishi ya kawaida. Hujilipia chenyewe kuanzia usomaji wa kwanza. Hufeli kwa njia mbili, zote zikiwa kimya. Ikiwa kiambishi awali kilichohifadhiwa kwenye cache kitabadilika kati ya maombi, utafutaji hautalingana kamwe, kwa sababu ni lazima kiambishi awali kilingane kikamilifu. Ikiwa kiambishi awali ni kifupi kuliko urefu wa chini kabisa unaoweza kuhifadhiwa kwenye cache wa mfano huo, ambao ni token 1,024 kwenye Sonnet 5 na 4,096 kwenye Haiku 4.5, hakuna kitu kitakachohifadhiwa kwenye cache na hakuna kosa litakalorejeshwa. Wakati cache_creation_input_tokens na cache_read_input_tokens zote zikisoma 0, cache haifanyi kazi yoyote.
Kwa nini bili yangu ilikua kwa kasi zaidi kuliko idadi ya ujumbe wangu?
Kwa sababu mazungumzo yote hutumwa tena katika kila hatua. Messages API haina hali (state), kwa hivyo hatua ya 20 ya gumzo hubeba hatua zote 19 za awali kama input tena. Kwa hatua zenye wastani wa token 500, mazungumzo ya hatua 20 hutuma takriban token 105,000 za kuingiza wakati maandishi ya mazungumzo (transcript) yakiwa na urefu wa token 10,000 pekee. Mizunguko ya wakala (agent loops) hufanya kazi kwa njia hiyo hiyo, kwa sababu kila matokeo ya zana (tool result) hubaki kwenye historia. Hifadhi kiambishi awali kisichobadilika kwenye cache, au fupisha hatua za awali na uziondoe kwenye ombi.