Kwa nini Claude ni ghali? Ufafanuzi wa hesabu ya token
Gundua kwa nini token za matokeo ni ghali mara tano zaidi na jinsi historia ya mazungumzo inavyoongeza gharama. Jifunze mbinu nne za kupunguza bili yako ya API ya Claude.
Kwa nini Claude ni ghali? Jibu fupi
Claude ni ghali kwa sababu nne zinazojilimbikiza. Token za matokeo (output tokens) hutoza mara tano ya bei ya token za pembejeo (input tokens). API haihifadhi kumbukumbu ya mazungumzo yako, kwa hivyo historia nzima hutumwa tena na kutozwa ada kila unapouliza swali jipya. Wakala (agent) hubadilisha swali moja kuwa mfululizo wa wito wa API, na kila wito hubeba historia hiyo inayozidi kukua. Zaidi ya hayo, bei ya mfano wa kisasa (frontier model) hupangwa kulingana na ugumu wa kazi inayofanya, si kulingana na gharama ya kuendesha mfano mdogo.
Token ni kipande cha maandishi. Kama mwongozo wa jumla, token moja ni takriban herufi nne, au karibu maneno 0.75 ya Kiingereza. Viwango hutolewa kwa kila milioni ya token, zikijulikana kama MTok (million tokens). Kila kiwango hapa chini ni cha API ya Claude kilichochapishwa kufikia Agosti 2026.
Bili nyingi za kushtukiza hutokana na sababu ya pili na ya tatu kwenye orodha hiyo. Watu kwa kawaida huamini kuwa majibu yanayoandikwa na Claude ndiyo yanayogharimu pesa. Katika kipindi cha wakala, uandishi mara nyingi huwa chini ya sehemu ya kumi ya bili nzima.
Viwango vilivyochapishwa, kwa hivyo tunakubaliana kuhusu namba hizi
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5,
"cache_read_usd": "0.10"
},
{
"label": "Sonnet 5, to Aug 31 2026",
"input_usd": 2,
"output_usd": 10,
"cache_read_usd": "0.20"
},
{
"label": "Sonnet 5, from Sep 1 2026",
"input_usd": 3,
"output_usd": 15,
"cache_read_usd": "0.30"
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25,
"cache_read_usd": "0.50"
}
]Angalia muundo badala ya namba kamili. Kila modeli inatoza mara tano zaidi kwa output kuliko kwa input. Opus 5 inagharimu 5 dola kwa kila milioni ya input tokens na 25 dola kwa kila milioni ya output tokens. Haiku 4.5 inagharimu 1 na 5. Kwa hivyo, tofauti kutoka kwa modeli ya bei nafuu zaidi hadi ile ya gharama kubwa zaidi ni mara tano, na tofauti kutoka kusoma hadi kuandika pia ni mara tano.
Sonnet 5 iko kwenye bei ya utangulizi ya 2 na 10 dola kwa kila milioni hadi Agosti 31, 2026. Kuanzia Septemba 1, 2026 itabadilika na kuwa 3 na 15. Viwango hubadilika kulingana na releases za modeli, kwa hivyo kagua viwango vya sasa kabla ya kuandaa bajeti kulingana navyo. Hakuna tier ya bure iliyo chini ya jedwali hili pia, ingawa akaunti mpya huanza na mkopo mdogo na baadhi ya sehemu za API hazigharimu chochote.
Safu ya mwisho ni kiwango cha kusoma cache (cache read rate). Hii ndiyo huamua gharama nyingi. Irudie baada ya kufanya hesabu.
Kwa nini token za pato (output) hugharimu mara tano zaidi ya token za ingizo (input)?
Kusoma na kuandika si kazi ya kiasi sawa. Token za ingizo huchakatwa kwa hatua moja. Model husoma prompt nzima kwa wakati mmoja na kazi huendeshwa kwa sambamba (parallel) kote, ndiyo maana prompt ya token 60,000 haichukui muda mrefu mara 60,000 kusomwa kuliko prompt ya token 1,000.
Token za pato huzalishwa moja baada ya nyingine. Kila token mpya inahitaji hatua yake ya kipekee kupitia model, na inahitaji kila token iliyotangulia kama muktadha (context). Kuandika token 1,000 kunamaanisha hatua 1,000, moja baada ya nyingine. Kazi hiyo ya mfululizo (serial) haiwezi kusambazwa kama inavyofanyika wakati wa kusoma, kwa hivyo kila token ya pato huishikilia hardware kwa muda mrefu zaidi.
Hii ndiyo sababu "fanya jibu liwe fupi" ni njia isiyo na nguvu kubwa kama watu wanavyotarajia. Inafanya kazi kwenye nusu ndogo ya bili ya wakala (agent bill).
Kwa nini mazungumzo yangu yote yanatozwa ada kila ninapojibu?
Claude API haina hali (stateless). Hakuna mazungumzo yanayohifadhiwa upande wa Anthropic ambayo unaongezea ujumbe mmoja. Kila ombi hubeba historia nzima ya ujumbe, na modeli husoma yote kabla ya kuandika chochote. Kwa hivyo, zamu ya 30 inatozwa ada kwa ajili ya zamu ya 1 hadi 29 pia.
Hii inamaanisha kuwa gharama ya mazungumzo hukua kwa kasi zaidi kuliko urefu wake. Zamu ya 1 inatoza muktadha mdogo. Zamu ya 40 inatoza muktadha mkubwa. Jumlisha zamu zote arobaini na utagundua umelipia mara nyingi zaidi idadi ya tokeni zilizowahi kuandikwa.
The data behind this chart
[
{
"turn": 1,
"context_tokens": "20,000"
},
{
"turn": 5,
"context_tokens": "32,000"
},
{
"turn": 10,
"context_tokens": "45,000"
},
{
"turn": 15,
"context_tokens": "55,000"
},
{
"turn": 20,
"context_tokens": "64,000"
},
{
"turn": 25,
"context_tokens": "74,000"
},
{
"turn": 30,
"context_tokens": "84,000"
},
{
"turn": 35,
"context_tokens": "92,000"
},
{
"turn": 40,
"context_tokens": "100,000"
}
]Kikao kilicho hapo juu kinaanza na 20,000 tokeni, ambazo ni prompt ya mfumo, ufafanuzi wa zana na faili za kwanza ambazo wakala alifungua. Kufikia zamu ya 40 muktadha unashikilia 100,000 tokeni. Piga wastani wa idadi hiyo kwa zamu zote arobaini na utapata takriban tokeni 60,000 zinazosomwa kwa kila ombi.
Kwa nini wakala (agent) hugharimu zaidi kuliko chat?
Chat ni ombi moja kwa kila swali. Wakala ni ombi moja kwa kila hatua. Kusoma faili ni hatua moja. Kuendesha jaribio (test) ni hatua moja. Kusoma matokeo ya jaribio ni hatua moja. Kuhariri faili ni hatua moja. Hatua arobaini ili kukamilisha kazi moja ni jambo la kawaida kwa wakala wa uandishi wa programu.
Gharama mbili za ziada huambatana na matumizi ya zana (tools). Ufafanuzi wa zana ni token za ingizo katika kila ombi, kwa sababu mfano (model) lazima uambiwe ni zana zipi zipo kila wakati. Anthropic huchapisha gharama hizi za ziada: mfumo wa matumizi ya zana hutumia token 286 kwenye Opus 5 wakati tool_choice ikiwa imewekwa kuwa auto, pamoja na token za schema zako za zana. Baadhi ya zana za upande wa seva hubeba ada tofauti pia. Utafutaji wa wavuti (web search) hutoza $10 kwa kila utafutaji 1,000 juu ya token zinazotumiwa na matokeo hayo.
Kila matokeo ya zana pia huwa muktadha wa kudumu. Amri inayochapisha mistari 3,000 huweka mistari hiyo 3,000 katika kila ombi kwa muda wote uliobakia wa kipindi hicho. Matumizi ya token kwa kila kipindi ambayo Claude Code huripoti hufanya hili lionekane: tazama namba ya ingizo ikipanda mara tu baada ya amri yenye matokeo mengi.
Hesabu za kikao kimoja halisi
Hapa kuna saa moja ya kazi ya uandishi wa programu kwa kutumia Opus 5. Maombi 40 ya API. Muktadha unakua kutoka token 20,000 hadi 100,000, hivyo wastani ni token 60,000 kwa kila ombi. Model huandika takriban token 700 kwa kila ombi, ambazo ni mchanganyiko wa wito mfupi wa zana (tool calls) na vizuizi vichache virefu vya msimbo.
Requests in the session: 40
Average context per request: 60,000 tokens
Total input tokens billed: 40 x 60,000 = 2,400,000
Input cost on Opus 5: 2,400,000 x $5 / 1,000,000 = $12.00
Total output tokens: 40 x 700 = 28,000
Output cost on Opus 5: 28,000 x $25 / 1,000,000 = $0.70
Session total = $12.70The data behind this chart
[
{
"label": "Input, context re-read",
"billed_tokens": "2,400,000",
"cost_usd": "12.00"
},
{
"label": "Output, code and tool calls",
"billed_tokens": "28,000",
"cost_usd": "0.70"
}
]Angalia mgawanyo huu. Gharama ya kusoma ni 12.00 dola na gharama ya kuandika ni 0.70 dola, kwa hivyo matokeo unayosoma kwa hakika ni takriban asilimia tano ya bili nzima. Model iliandika token 28,000 na ikatozwa ada kwa kusoma token 2,400,000. Hakuna mtu aliyeandika token milioni 2.4. Token zilezile 100,000 zilisomwa mara kwa mara.
Lever 1: prompt caching, ambayo ndiyo kubwa zaidi
Prompt caching huhifadhi umbo lililochakatwa la sehemu ya awali ya prompt yako ambayo haibadiliki. Katika ombi linalofuata, sehemu hiyo husomwa kutoka kwenye cache badala ya kuchakatwa tena. Kuandika kwenye cache hugharimu mara 1.25 ya kiwango cha input kwa cache ya dakika tano, au mara 2 kwa cache ya saa moja. Kusoma kutoka humo hugharimu mara 0.1 ya kiwango cha input. Kwenye Opus 5, hiyo ni 0.50 dola kwa milioni badala ya 5 dola.
Tumia hilo kwenye kikao kilicho hapo juu. Kila moja ya token 100,000 huandikwa kwenye cache mara moja kadiri mazungumzo yanavyokua. Token nyingine 2,300,000 za input huwa ni usomaji wa cache.
Tokens written to cache: 100,000
Cache write at 1.25x input: 100,000 x $6.25 / 1,000,000 = $0.63
Tokens read from cache: 2,300,000
Cache read at 0.1x input: 2,300,000 x $0.50 / 1,000,000 = $1.15
Output cost, unchanged = $0.70
Session total = $2.48Unaashiria sehemu inayoweza kuhifadhiwa kwenye cache kwa kutumia sehemu ya cache_control. Weka breakpoint baada ya maudhui ambayo hayabadiliki kati ya zamu moja na nyingine: system prompt na ufafanuzi wa tool. Hati ndefu unayorejelea mara kwa mara inapaswa kuwa katika kizuizi hicho kisichobadilika.
{
"model": "claude-opus-5",
"system": [
{
"type": "text",
"text": "<long, stable instructions>",
"cache_control": {"type": "ephemeral"}
}
],
"messages": [{"role": "user", "content": "..."}]
}Mpangilio wa prompt yako sasa huamua gharama. Cache hit inahitaji ulinganifu kamili kuanzia mwanzo kabisa wa prompt, kwa hivyo chochote kinachobadilika katika kila ombi lazima kiwekwe baada ya kila kitu kisichobadilika. Ukiweka timestamp juu ya system prompt yako, unavunja cache katika kila zamu: sehemu nzima ya awali inakuwa miss, na unalipa mara 1.25 ya kiwango cha input ili kuiandika tena.
Jibu litakuambia kama imefanikiwa. Tuma ombi na usome kizuizi cha usage.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-opus-5",
"max_tokens": 256,
"messages": [{"role": "user", "content": "Hello"}]
}'Kila jibu hubeba kitu cha usage kama hiki:
{
"usage": {
"input_tokens": 105,
"cache_creation_input_tokens": 7345,
"cache_read_input_tokens": 7123,
"output_tokens": 239
}
}Ombi la kurudia ambalo bado linaonyesha 0 ndani ya cache_read_input_tokens linamaanisha kuwa cache haitumiki. Sababu ya kawaida ni kwamba kitu fulani kabla ya breakpoint yako kimebadilika. Cache ya dakika tano pia huisha muda wake, kwa hivyo ombi lililotumwa dakika sita baadaye litakuwa miss ikifuatiwa na uandishi mpya.
Ngazi ya 2: elekeza kazi rahisi kwa modeli ndogo
Zamu nyingi katika kipindi cha wakala si ngumu. Kufungua faili, kuendesha formatter, au kusoma diff. Hizi hazihitaji modeli ya kiwango cha juu. Kuzielekeza kwa Haiku 4.5 kunapunguza gharama ya input kutoka 5 dola kwa milioni hadi 1.
The data behind this chart
[
{
"label": "Opus 5, no caching",
"session_cost_usd": "12.70"
},
{
"label": "Opus 5, cached",
"session_cost_usd": "2.48"
},
{
"label": "Sonnet 5, cached",
"session_cost_usd": "0.99"
},
{
"label": "Haiku 4.5, cached",
"session_cost_usd": "0.50"
}
]Kipindi hicho hicho kinagharimu 12.70 dola kwenye Opus 5 bila caching, 2.48 na caching, 0.99 kwenye Sonnet 5 na caching, na 0.50 kwenye Haiku 4.5 na caching. Caching pekee huondoa takriban asilimia themanini ya gharama. Chaguo la modeli huondoa sehemu kubwa ya gharama iliyobaki.
Hapa kuna angalizo la kweli. Modeli ya bei nafuu inayotoa jibu lisilo sahihi itakulazimu kurudia kipindi chote, pamoja na kupoteza muda wako. Elekeza kazi kulingana na ugumu wake, si kwa bei. Kanuni hii inafanya kazi pande zote: Claude Fable 5 ina bei ya juu kuliko Opus 5 kwa $10 na $50 kwa milioni, kwa hivyo soma nini viwango hivyo vinakupa kabla ya kuelekeza zamu huko. Kuchagua kati ya Opus, Sonnet na Haiku inaelezea mahali ambapo kila moja inafaa zaidi.
Ngazi ya 3: usafi wa muktadha
Kila token unayoiacha kwenye muktadha inatozwa gharama katika kila hatua inayofuata, kwa hivyo kuondoa token mapema kuna thamani kubwa zaidi kuliko kuiondoa baadaye. Faili la token 5,000 lililowekwa kwenye hatua ya 5 ya kipindi cha hatua 40 litasomwa mara 35 zaidi. Hiyo ni token 175,000 za ziada za kuingiza, ambazo ni karibu dola moja kwenye Opus 5 kwa ajili ya kubandika bila uangalifu.
Tabia nne zinazobadilisha namba hiyo:
- Anzisha kipindi kipya kwa ajili ya kazi mpya badala ya kuendeleza ya jana.
- Chuja amri zenye kelele kabla ya matokeo kufika kwa model, kwa kutumia kitu kama
head -50, badala ya kufanya hivyo baadaye. - Omba utendaji mmoja unaouhitaji, si faili zima.
- Kipindi kirefu kinapoacha kupiga hatua, omba muhtasari na uanze upya ukitumia muhtasari huo. Muhtasari ni token mia chache. Nakala ya mazungumzo ni laki moja.
Hatua ya 4: tumia batch kwa kila kitu kisichohitaji majibu ya haraka
Batch API huchakata maombi kwa njia ya asynchronous na hupunguza gharama za input na output kwa asilimia 50. Ikiwa kazi haihitaji jibu ndani ya sekunde moja, itume kupitia batch. Hii inahusu kazi za classification, extraction, summarising ya backlog, na evaluation runs. Punguzo la batch huongezeka sambamba na prompt caching. Hii haitumiki kwenye interactive session, kwa sababu hakuna kitu cha kusubiriwa hapo.
Je, ninalipishwa bei ya juu kupita kiasi?
Hili ndilo swali la msingi lililojificha nyuma ya "kwa nini Claude ni ghali", kwa hivyo hili hapa ni jibu la moja kwa moja. Viwango vimechapishwa, ni sawa kwa kila mtu kwenye viwango vya kawaida (standard tiers), na vinatozwa kwa kila token. Isipokuwa ni mkataba uliokubaliwa, na hata hapo Claude Enterprise pricing huweka gharama ya kila mtumiaji (per seat) juu ya token zilezile zinazopimwa badala ya kuzibadilisha. Hakuna chochote kwenye ankara ambacho ni cha hiari. Kile ambacho jedwali la viwango haliwezi kukuambia ni kama unapata thamani, kwa sababu linapanga bei ya token na wewe unajali matokeo.
Kwa hivyo, panga bei kulingana na matokeo. Kikao kilicho hapo juu kiligharimu 12.70 dola bila caching. Ikiwa kilikamilisha kipengele (feature) ambacho kingekuchukua saa moja, hiyo ni bei nafuu. Ikiwa kilitumia mizunguko arobaini kikizunguka bila lengo, 12.70 dola zilezile hazikununua chochote, na kiwango cha bei hakikuwa tatizo kamwe.
Hii ndiyo sehemu inayostahili kukumbukwa. Ankara yako huongezeka kulingana na token, si kulingana na thamani. Kikao chenye tija na kikao kilichopoteza muda vyenye urefu sawa vinagharimu kiasi kilekile. Ndiyo maana vigezo vinne (four levers) ni muhimu zaidi kuliko jedwali la viwango: huwezi kujadiliana kuhusu bei ya kila token, lakini wewe ndiye unaoamua ni token ngapi kazi hiyo inahitaji.
Kwa hivyo, fuatilia dola kwa kila kazi iliyokamilika, si dola kwa kila mwezi. Ikiwa namba hiyo inashuka wakati unarekebisha caching na routing, usanidi wako unazidi kuwa bora hata wakati jumla ya kila mwezi inapoongezeka, kwa sababu jumla hiyo inaongezeka kutokana na kufanya kazi zaidi.
Mambo yasiyopunguza gharama zako
Ushauri fulani maarufu hauna faida kubwa. Kumwambia modeli "kuwa mfupi" hupunguza matokeo, na matokeo yalikuwa asilimia tano tu ya mfano wa bili. Kufupisha swali lako mwenyewe huokoa token chache tu ikilinganishwa na muktadha wa token 60,000. Kuzima "extended thinking" husaidia tu pale ambapo token za kufikiri zilikuwa sehemu kubwa ya matokeo yako, na sehemu ya matumizi (usage block) hukuambia hivyo badala ya kukuacha ukikisia.
Dirisha kubwa la muktadha (context window) lenyewe si gharama. Kwenye Claude 4.6 na matoleo mapya zaidi, dirisha zima la token milioni moja hutoza kwa kiwango cha kawaida cha kila token, kwa hivyo ombi la token 900,000 hugharimu kiasi sawa kwa kila token na ombi la token 9,000. Ukubwa wa dirisha haupangi bei. Unachochagua kuweka ndani ya dirisha ndicho kinachopanga.
Mambo mengine mawili yanapaswa kupangwa badala ya kufanyiwa katika kikao kimoja. Ikiwa unatumia huduma kila siku na kwa njia ya mwingiliano, linganisha malipo kwa kila token dhidi ya mpango wa bei isiyobadilika (flat plan): ulinganisho wa gharama za API na usajili hufanya hesabu hiyo. Ikiwa mpango wa bei isiyobadilika ni nafuu na unalinganisha na mtoa huduma mwingine kwa wakati mmoja, mipango ya Claude na ChatGPT iliyopangwa kando kando hufanya ulinganisho huo huo kwa zote mbili. Na ikiwa wakala (agent) anaendeshwa bila kusimamiwa kwenye seva, weka kikomo cha matumizi (hard spend cap) kabla ya kurekebisha kitu kingine chochote, jambo ambalo vidhibiti vya gharama kwa wakala wa AI kwenye VPS hulishughulikia. Kwa ufahamu wa kawaida wa kiwango, kile ambacho token milioni moja za Claude hununua kihalisi hubadilisha jedwali la viwango kuwa kurasa za maandishi.
FAQ
Kwa nini bili yangu ya Claude ilipanda nilipoanza kutumia agent?
Kwa sababu agent hutuma maombi mengi kwa kila swali, na kila ombi hubeba mazungumzo yote yaliyotangulia. Chat ya kawaida hutuma ombi moja kwa kila swali. Coding agent hutuma ombi moja kwa kila hatua, na hatua arobaini kwa kazi moja ni jambo la kawaida. Kila moja ya maombi hayo hutoza gharama kwa context nzima, hivyo kikao kinachofikia token 100,000 kinaweza kutoza zaidi ya token milioni mbili za input kwa jumla. Soma input_tokens na cache_read_input_tokens katika API response ili kuona hili moja kwa moja.
Je, prompt caching hupunguza bili kwa kiasi kikubwa kweli?
Katika mfano uliotolewa, ilipunguza gharama ya kikao kutoka 12.70 dola hadi 2.48 dola, kwa sababu kusoma kutoka kwenye cache hugharimu sehemu ya kumi ya bei ya input. Akiba inategemea kabisa kiwango chako cha hit rate. Kwa cache ya dakika tano, inajilipia baada ya usomaji mmoja tu, kwa kuwa uandishi hugharimu mara 1.25 ya input na usomaji hugharimu mara 0.1. Ikiwa prompt yako inabadilika karibu na mwanzo katika kila ombi, hutapata hits zozote na utalipia gharama ya ziada ya uandishi bila faida. Thibitisha na cache_read_input_tokens kabla ya kudhani kuwa inafanya kazi.
Je, nitumie Haiku kwa kila kitu?
Hapana. Haiku 4.5 hugharimu 1 dola kwa kila milioni ya token za input dhidi ya 5 kwa Opus 5, kwa hivyo akiba ni ya kweli katika kazi rahisi zenye ujazo mkubwa kama vile classification na routing. Jibu lisilo sahihi katika kazi ngumu hugharimu zaidi ya kiasi kilichookolewa na model, kwa sababu unalipia marudio ya kazi na muda wako mwenyewe juu yake. Mbinu inayofaa ni mchanganyiko: tumia model ndogo kwa kazi za kiufundi, na model ya hali ya juu kwa kazi inayohitaji maamuzi.
Je, API ni nafuu kuliko usajili wa Claude?
Inategemea jinsi matumizi yako yalivyo thabiti. Usajili una bei isiyobadilika ya kila mwezi yenye mipaka ya matumizi. API inatoza kwa kila token bila ukomo, jambo ambalo ni nafuu wakati matumizi yako ni madogo au yanakuja kwa vipindi, na ni ghali zaidi unapoitumia sana kila siku ya kazi. Chukua wastani wa token zako kwa siku kutoka kwenye usage block, piga bei kulingana na rate ya model yako, kisha linganisha kiasi hicho na bei ya mpango, ambayo kwa tier ya kuanzia imeelezwa katika gharama za Claude Pro na mahali mipaka yake ya matumizi inapokuzuia. Ikiwa jumla inaonyesha API ni nafuu, kuacha mpango au kushuka tier hakupotezi mwezi ambao tayari umeshalipia, kwa sababu ufikiaji wako unaendelea hadi mwisho wa kipindi cha sasa cha bili.