SSD Nodes Learn 🎉 VPS kutoka $4.99/mwezi
Mwongozo Matt ConnorNa Matt Connor · Imeboreshwa 2026-08-07

Kwa nini Claude ni ghali? Hesabu ya token

Gharama ya token za matokeo ni mara tano ya pembejeo na historia ya mazungumzo hutumwa kila hatua. Jifunze hesabu halisi ya kikao kimoja na mbinu nne za kupunguza bili.

Kwa nini Claude ni ghali? Jibu fupi

Claude ni ghali kwa sababu nne zinazojilimbikiza. Token za matokeo (output tokens) hutoza bei mara tano ya ile ya token za pembejeo (input tokens). API haihifadhi kumbukumbu ya mazungumzo yako, kwa hivyo historia nzima hutumwa tena na kutozwa tena katika kila hatua. Wakala (agent) hugeuza swali moja kuwa mfululizo wa API calls kadhaa, na kila call hubeba historia hiyo inayokua. Zaidi ya hayo, mfumo wa frontier (frontier model) hutoza bei kulingana na ugumu wa kazi inayofanya, si kulingana na gharama ya kuendesha mfumo mdogo.

Token ni kipande cha maandishi. Kama mwongozo wa jumla, token moja ni takriban herufi nne, au karibu maneno 0.75 ya Kiingereza. Viwango hutajwa kwa kila milioni ya token, zikiandikwa kama MTok (million tokens). Kila kiwango hapa chini ni kiwango rasmi cha Claude API kufikia Agosti 2026.

Bili nyingi za kushtukiza hutokana na sababu ya pili na ya tatu kwenye orodha hiyo. Watu kwa kawaida hufika wakiamini kuwa majibu yanayoandikwa na Claude ndiyo yanayogharimu pesa. Katika kikao cha wakala, uandishi mara nyingi huwa chini ya sehemu ya kumi ya bili nzima.

Viwango vilivyochapishwa, kwa hivyo tunakubaliana kuhusu namba

ChartPublished Claude API rates, US dollars per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5,
    "cache_read_usd": "0.10"
  },
  {
    "label": "Sonnet 5, to Aug 31 2026",
    "input_usd": 2,
    "output_usd": 10,
    "cache_read_usd": "0.20"
  },
  {
    "label": "Sonnet 5, from Sep 1 2026",
    "input_usd": 3,
    "output_usd": 15,
    "cache_read_usd": "0.30"
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25,
    "cache_read_usd": "0.50"
  }
]

Angalia muundo badala ya namba kamili. Kila modeli inatoza mara tano zaidi kwa matokeo (output) kuliko kwa ingizo (input). Opus 5 inagharimu 5 dola kwa kila milioni ya token za ingizo na 25 dola kwa kila milioni ya token za matokeo. Haiku 4.5 inagharimu 1 na 5. Kwa hivyo, tofauti kutoka kwa modeli ya bei nafuu zaidi hadi ile ya gharama kubwa zaidi ni mara tano, na tofauti kutoka kusoma hadi kuandika pia ni mara tano.

Sonnet 5 inatumia bei ya utangulizi ya 2 na 10 dola kwa kila milioni hadi Agosti 31, 2026. Kuanzia Septemba 1, 2026 itabadilika hadi 3 na 15. Viwango hubadilika kulingana na matoleo ya modeli, kwa hivyo hakiki viwango vya sasa kabla ya kuandaa bajeti yako kulingana navyo.

Safu ya mwisho ni kiwango cha kusoma kutoka kwenye cache (cache read rate). Hii ndiyo huamua sehemu kubwa ya bili. Rejea hapa baada ya kufanya hesabu.

Kwa nini token za pato (output) hugharimu mara tano zaidi ya token za ingizo (input)?

Kusoma na kuandika si kazi ya kiwango sawa. Token za ingizo huchakatwa kwa hatua moja. Model husoma prompt nzima kwa wakati mmoja na kazi hiyo huendeshwa kwa sambamba (parallel) katika prompt nzima, ndiyo maana prompt ya token 60,000 haichukui muda mrefu mara 60,000 kusomwa kuliko prompt ya token 1,000.

Token za pato huzalishwa moja baada ya nyingine. Kila token mpya inahitaji hatua yake yenyewe kupitia model, na inahitaji kila token iliyotangulia kama muktadha. Kuandika token 1,000 kunamaanisha hatua 1,000, moja baada ya nyingine. Kazi hiyo ya mfululizo (serial) haiwezi kusambazwa kama inavyoweza kufanyika wakati wa kusoma, kwa hivyo kila token ya pato huishikilia hardware kwa muda mrefu zaidi.

Hii ndiyo sababu "fanya jibu liwe fupi" ni njia isiyo na nguvu kama watu wanavyotarajia. Inafanya kazi kwenye nusu ndogo ya bili ya wakala.

Kwa nini mazungumzo yangu yote yanatozwa ada kila ninapojibu?

Claude API haina hali (stateless). Hakuna mazungumzo yanayohifadhiwa upande wa Anthropic ambayo unaongezea ujumbe mmoja. Kila ombi hubeba historia nzima ya ujumbe, na modeli husoma yote kabla ya kuandika chochote. Kwa hivyo, zamu ya 30 inatozwa ada kwa ajili ya zamu ya 1 hadi 29 pia.

Hii inamaanisha kuwa gharama ya mazungumzo hukua kwa kasi zaidi kuliko urefu wake. Zamu ya 1 inatoza muktadha mdogo. Zamu ya 40 inatoza muktadha mkubwa. Jumlisha zamu zote arobaini na utagundua umelipia mara nyingi zaidi idadi ya tokeni zilizowahi kuandikwa.

ChartContext size at each turn of a 40 turn agent session
The data behind this chart
[
  {
    "turn": 1,
    "context_tokens": "20,000"
  },
  {
    "turn": 5,
    "context_tokens": "32,000"
  },
  {
    "turn": 10,
    "context_tokens": "45,000"
  },
  {
    "turn": 15,
    "context_tokens": "55,000"
  },
  {
    "turn": 20,
    "context_tokens": "64,000"
  },
  {
    "turn": 25,
    "context_tokens": "74,000"
  },
  {
    "turn": 30,
    "context_tokens": "84,000"
  },
  {
    "turn": 35,
    "context_tokens": "92,000"
  },
  {
    "turn": 40,
    "context_tokens": "100,000"
  }
]

Kikao kilicho hapo juu kinaanza na tokeni 20,000, ambazo ni system prompt, ufafanuzi wa zana (tool definitions) na faili za kwanza ambazo wakala (agent) alifungua. Kufikia zamu ya 40, muktadha una tokeni 100,000. Piga wastani wa tokeni hizo katika zamu zote arobaini na utapata takriban tokeni 60,000 zinazosomwa kwa kila ombi.

Kwa nini wakala (agent) anagharimu zaidi kuliko chat?

Chat ni ombi moja kwa kila swali. Wakala ni ombi moja kwa kila hatua. Kusoma faili ni hatua moja. Kuendesha jaribio (test) ni hatua moja. Kusoma matokeo ya jaribio ni hatua moja. Kuhariri faili ni hatua moja. Hatua arobaini ili kukamilisha kazi moja ni jambo la kawaida kwa wakala wa uandishi wa programu.

Gharama mbili za ziada huambatana na matumizi ya zana. Ufafanuzi wa zana ni token za ingizo katika kila ombi, kwa sababu mfano (model) lazima uambiwe ni zana zipi zipo kila wakati. Anthropic huchapisha gharama hiyo ya ziada: mfumo wa matumizi ya zana (tool use system prompt) ni token 286 kwenye Opus 5 ikiwa tool_choice imewekwa kuwa auto, pamoja na token za skema zako za zana. Baadhi ya zana za upande wa seva hubeba ada tofauti pia. Utafutaji wa wavuti (web search) hutozwa $10 kwa kila utafutaji 1,000 juu ya token zinazotumiwa na matokeo hayo.

Kila matokeo ya zana pia ni muktadha wa kudumu. Amri inayochapisha mistari 3,000 huweka mistari hiyo 3,000 katika kila ombi kwa muda wote uliobakia wa kikao. Matumizi ya token kwa kila kikao ambayo Claude Code huripoti hufanya hili lionekane: tazama namba ya ingizo ikipanda mara tu baada ya amri yenye matokeo mengi.

Hesabu za kikao kimoja cha kweli

Hili ni saa moja ya kweli ya uandishi wa wakala kwenye Opus 5. Maombi 40 ya API. Muktadha unakua kutoka token 20,000 hadi 100,000, hivyo wastani ni takriban token 60,000 kwa kila ombi. Modeli huandika takriban token 700 kwa kila ombi, ambazo ni mchanganyiko wa miito mifupi ya zana na vizuizi vichache virefu vya msimbo.

Requests in the session:      40
Average context per request:  60,000 tokens

Total input tokens billed:    40 x 60,000                    = 2,400,000
Input cost on Opus 5:         2,400,000 x $5 / 1,000,000     = $12.00

Total output tokens:          40 x 700                       =    28,000
Output cost on Opus 5:        28,000 x $25 / 1,000,000       =  $0.70

Session total                                                = $12.70
ChartWhere the money went in one 40 turn Opus 5 session, no caching
The data behind this chart
[
  {
    "label": "Input, context re-read",
    "billed_tokens": "2,400,000",
    "cost_usd": "12.00"
  },
  {
    "label": "Output, code and tool calls",
    "billed_tokens": "28,000",
    "cost_usd": "0.70"
  }
]

Angalia mgawanyo huu. Gharama ya kusoma ni 12.00 dola na gharama ya kuandika ni 0.70 dola, kwa hivyo matokeo unayosoma kwa hakika ni takriban asilimia tano ya bili. Modeli iliandika token 28,000 na ikatozwa ada kwa ajili ya kusoma token 2,400,000. Hakuna mtu aliyeandika token milioni 2.4. Token zilezile 100,000 zilisomwa mara kwa mara.

Ngazi ya 1: prompt caching, ambayo ndiyo njia kuu

Prompt caching huhifadhi matokeo ya uchakataji wa sehemu ya awali ya prompt yako ambayo haibadiliki. Katika ombi linalofuata, sehemu hiyo husomwa kutoka kwenye cache badala ya kuchakatwa upya. Kuandika kwenye cache hugharimu mara 1.25 ya bei ya input kwa cache ya dakika tano, au mara 2 kwa cache ya saa moja. Kusoma kutoka kwenye cache hugharimu mara 0.1 ya bei ya input. Kwenye Opus 5, hiyo ni 0.50 dola kwa kila milioni badala ya 5 dola.

Tumia kanuni hiyo kwenye kikao kilichotajwa hapo juu. Kila token kati ya 100,000 huandikwa kwenye cache mara moja kadiri mazungumzo yanavyokua. Token nyingine 2,300,000 za input huwa ni usomaji wa cache.

Tokens written to cache:      100,000
Cache write at 1.25x input:   100,000 x $6.25 / 1,000,000    = $0.63

Tokens read from cache:       2,300,000
Cache read at 0.1x input:     2,300,000 x $0.50 / 1,000,000  = $1.15

Output cost, unchanged                                       = $0.70

Session total                                                = $2.48

Unaweka alama kwenye sehemu inayoweza kuhifadhiwa kwa kutumia sehemu ya cache_control. Weka breakpoint baada ya maudhui ambayo hayabadiliki kati ya zamu moja na nyingine: system prompt na ufafanuzi wa tool. Hati ndefu unayorejelea mara kwa mara inapaswa kuwekwa kwenye kizuizi hicho kisichobadilika.

{
  "model": "claude-opus-5",
  "system": [
    {
      "type": "text",
      "text": "<long, stable instructions>",
      "cache_control": {"type": "ephemeral"}
    }
  ],
  "messages": [{"role": "user", "content": "..."}]
}

Mpangilio wa prompt yako sasa huamua gharama. Ili kupata cache hit, lazima kuwe na ulinganifu kamili kuanzia mwanzo wa prompt, kwa hivyo chochote kinachobadilika katika kila ombi lazima kiwekwe baada ya vile visivyobadilika. Ukiweka timestamp juu ya system prompt yako, utavunja cache katika kila zamu: sehemu nzima ya awali itakuwa cache miss, na utalipa mara 1.25 ya bei ya input ili kuiandika upya.

Jibu litakuambia kama imefanikiwa. Tuma ombi na usome sehemu ya usage.

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 256,
    "messages": [{"role": "user", "content": "Hello"}]
  }'

Kila jibu hubeba kitu cha usage kama hiki:

{
  "usage": {
    "input_tokens": 105,
    "cache_creation_input_tokens": 7345,
    "cache_read_input_tokens": 7123,
    "output_tokens": 239
  }
}

Ombi la kurudia ambalo bado linaonyesha 0 ndani ya cache_read_input_tokens linamaanisha kuwa cache haitumiki. Sababu ya kawaida ni kwamba kuna kitu kilichobadilika kabla ya breakpoint yako. Cache ya dakika tano pia huisha muda wake, kwa hivyo ombi linalotumwa baada ya dakika sita litakuwa cache miss ikifuatiwa na uandishi mpya.

Hatua ya 2: elekeza kazi rahisi kwa modeli ndogo

Mageuzi mengi katika kipindi cha wakala (agent session) si magumu. Kufungua faili, kuendesha formatter, au kusoma diff. Haya hayahitaji modeli ya kiwango cha juu (frontier model). Kuyaelekeza kwa Haiku 4.5 kunapunguza gharama ya input kutoka 5 dola kwa milioni hadi 1.

ChartThe same 40 turn session under four setups, US dollars
The data behind this chart
[
  {
    "label": "Opus 5, no caching",
    "session_cost_usd": "12.70"
  },
  {
    "label": "Opus 5, cached",
    "session_cost_usd": "2.48"
  },
  {
    "label": "Sonnet 5, cached",
    "session_cost_usd": "0.99"
  },
  {
    "label": "Haiku 4.5, cached",
    "session_cost_usd": "0.50"
  }
]

Kipindi hicho hicho kinagharimu 12.70 dola ukitumia Opus 5 bila caching, 2.48 ukiwa na caching, 0.99 kwenye Sonnet 5 na caching, na 0.50 kwenye Haiku 4.5 na caching. Caching pekee huondoa takriban asilimia themanini ya gharama. Chaguo la modeli huondoa sehemu kubwa ya gharama iliyobaki.

Hapa kuna angalizo la kweli. Modeli ya bei nafuu inayotoa jibu lisilo sahihi itakulazimu kurudia kipindi chote, pamoja na kupoteza muda wako. Elekeza kazi kulingana na ugumu wake, si kwa bei. Kuchagua kati ya Opus, Sonnet na Haiku inaelezea uwezo wa kila moja.

Ngazi ya 3: usafi wa muktadha

Kila token unayoiacha kwenye muktadha inatozwa gharama katika kila zamu inayofuata, kwa hivyo kuondoa token mapema kuna thamani kubwa zaidi kuliko kuiondoa baadaye. Faili yenye token 5,000 iliyowekwa kwenye zamu ya 5 ya kipindi cha zamu 40 inasomwa mara 35 zaidi. Hiyo ni token 175,000 za ziada za kuingiza, ambazo ni karibu dola moja kwenye Opus 5 kwa ajili ya kubandika bila uangalifu.

Tabia nne zinazobadilisha namba hiyo:

  • Anzisha kipindi kipya kwa ajili ya kazi mpya badala ya kuendeleza ya jana.
  • Chuja amri zenye kelele kabla ya matokeo kufika kwa modeli, kwa kutumia kitu kama head -50, badala ya kufanya hivyo baadaye.
  • Omba utendaji mmoja unaouhitaji, si faili nzima.
  • Kipindi kirefu kinapoacha kupiga hatua, omba muhtasari na uanze upya ukitumia muhtasari huo. Muhtasari una token mia chache. Nakala ya mazungumzo ina laki moja.

Hatua ya 4: fanya batch kwa kila kitu kisichohitaji majibu ya haraka

Batch API huchakata maombi kwa njia ya asynchronous na hupunguza gharama kwa asilimia 50 kwa input na output. Ikiwa kazi haihitaji jibu ndani ya sekunde moja, ifanyie batch. Hii inahusu kazi za classification, extraction, muhtasari wa backlog, na uendeshaji wa evaluation. Punguzo la batch huongezeka pamoja na prompt caching. Halitumiki kwenye session ya interactive, kwa sababu hakuna kitu cha kusubiriwa hapo.

Je, ninaibiwa?

Hili ndilo swali la msingi lililojificha nyuma ya "kwa nini Claude ni ghali", kwa hivyo hili hapa ni jibu la moja kwa moja. Viwango vimechapishwa, ni sawa kwa kila mtu kwenye ngazi za kawaida, na vinatozwa kwa kila token. Hakuna chochote kwenye ankara kinachotozwa kwa hiari. Kile ambacho kadi ya viwango haiwezi kukuambia ni kama unapata thamani, kwa sababu inatoza token wakati wewe unajali matokeo.

Kwa hivyo, pima thamani ya matokeo badala ya bei. Kikao kilicho hapo juu kiligharimu 12.70 dola bila kutumia caching. Ikiwa kilikamilisha kipengele ambacho kingekuchukua saa moja, hiyo ni bei nafuu. Ikiwa kilitumia mizunguko arobaini kikizunguka bila lengo, kiasi hicho hicho cha 12.70 dola hakikununua chochote, na kiwango cha bei hakikuwa tatizo kamwe.

Hii ndiyo sehemu inayostahili kukumbukwa. Ankara yako huongezeka kulingana na token, si kulingana na thamani. Kikao chenye tija na kikao kilichopoteza muda vyenye urefu sawa vinagharimu kiasi sawa. Ndiyo maana vigezo vinne ni muhimu zaidi kuliko kadi ya viwango: huwezi kujadiliana kuhusu bei kwa kila token, lakini wewe ndiye unayeamua ni token ngapi kazi hiyo inahitaji.

Kwa hivyo, fuatilia dola kwa kila kazi iliyokamilika, si dola kwa kila mwezi. Ikiwa namba hiyo inashuka wakati unarekebisha caching na routing, usanidi wako unazidi kuwa bora hata kama jumla ya kila mwezi inapanda, kwa sababu jumla hiyo inapanda kwa sababu ya kufanya kazi zaidi.

Mambo yasiyopunguza gharama zako

Ushauri fulani maarufu hauna faida kubwa. Kumwambia modeli "kuwa mfupi" hupunguza matokeo, na matokeo yalikuwa asilimia tano tu ya mfano wa bili. Kufupisha swali lako huokoa token chache tu ikilinganishwa na muktadha wa token 60,000. Kuzima extended thinking husaidia tu pale ambapo token za kufikiri zilikuwa sehemu kubwa ya matokeo yako, na sehemu ya matumizi (usage block) hukuambia hivyo badala ya kukuacha ukikisia.

Dirisha kubwa la muktadha (context window) lenyewe si gharama. Kwenye Claude 4.6 na matoleo ya baadaye, dirisha zima la token milioni moja hutoza ada ya kawaida kwa kila token, kwa hivyo ombi la token 900,000 hugharimu kiasi sawa kwa kila token kama ombi la token 9,000. Ukubwa wa dirisha haupangi bei. Unachochagua kuweka ndani ya dirisha ndicho kinachopanga bei.

Mambo mengine mawili yanapaswa kupangwa badala ya kufanywa katika kikao kimoja. Ikiwa unatumia huduma kila siku na kwa njia ya mwingiliano, linganisha malipo kwa kila token dhidi ya mpango wa bei isiyobadilika: ulinganisho wa gharama za API na usajili hufanya hesabu hiyo. Na ikiwa wakala (agent) anaendeshwa bila kusimamiwa kwenye seva, weka kikomo cha matumizi (hard spend cap) kabla ya kurekebisha kitu kingine chochote, jambo ambalo vidhibiti vya gharama kwa wakala wa AI kwenye VPS linashughulikia. Kwa mtazamo wa kawaida wa kiwango, kile ambacho token milioni moja za Claude hununua kihalisi hubadilisha jedwali la viwango kuwa kurasa za maandishi.

FAQ

Kwa nini bili yangu ya Claude ilipanda nilipoanza kutumia agent?

Kwa sababu agent hutuma maombi mengi kwa kila swali, na kila ombi hubeba mazungumzo yote yaliyotangulia. Chat ya kawaida hutuma ombi moja kwa kila swali. Coding agent hutuma ombi moja kwa kila hatua, na hatua arobaini kwa kazi moja ni jambo la kawaida. Kila moja ya maombi hayo hutoza gharama kwa muktadha mzima, hivyo kikao kinachomalizika na token 100,000 kinaweza kutoza zaidi ya token milioni mbili za input kwa jumla. Soma input_tokens na cache_read_input_tokens katika majibu ya API ili kuona hili moja kwa moja.

Je, prompt caching hupunguza bili kwa kiasi kikubwa kweli?

Katika mfano uliotolewa, ilipunguza gharama ya kikao kutoka 12.70 dola hadi 2.48 dola, kwa sababu usomaji kutoka kwenye cache hugharimu sehemu ya kumi ya bei ya input. Akiba inategemea kabisa kiwango chako cha hit rate. Kwa cache ya dakika tano, inajilipia baada ya usomaji mmoja tu, kwa kuwa uandishi hugharimu mara 1.25 ya input na usomaji hugharimu mara 0.1. Ikiwa prompt yako inabadilika mwanzoni mwa kila ombi, hutapata hits zozote na utalipia gharama ya ziada ya uandishi bila faida. Thibitisha na cache_read_input_tokens kabla ya kudhani kuwa inafanya kazi.

Je, nitumie Haiku kwa kila kitu?

Hapana. Haiku 4.5 hugharimu 1 dola kwa kila milioni ya token za input ikilinganishwa na 5 kwa Opus 5, hivyo akiba ni ya kweli katika kazi rahisi zenye ujazo mkubwa kama vile classification na routing. Jibu lisilo sahihi katika kazi ngumu hugharimu zaidi ya kiasi ambacho model ingeokoa, kwa sababu unalipia marudio ya kazi na muda wako binafsi juu yake. Mfumo unaofaa ni mchanganyiko: tumia model ndogo kwa kazi za kawaida, na model ya kiwango cha juu kwa kazi inayohitaji maamuzi.

Je, API ni nafuu kuliko usajili wa Claude?

Inategemea jinsi matumizi yako yalivyo thabiti. Usajili ni bei isiyobadilika ya kila mwezi yenye mipaka ya matumizi. API hutoza kwa kila token bila ukomo, jambo ambalo ni nafuu wakati matumizi yako ni madogo au yanakuja kwa vipindi, na ni ghali zaidi unapoitumia sana kila siku ya kazi. Chukua wastani wa token zako kwa siku kutoka kwenye sehemu ya matumizi, piga hesabu kwa bei ya model yako, kisha linganisha kiasi hicho na bei ya mpango wa usajili.