SSD Nodes Learn Hosting plans →
Mwongozo Matt ConnorNa Matt Connor · Imeboreshwa 2026-08-31

Token ni nini ndani ya Claude na gharama zake

Token moja ya Claude ni sawa na herufi 3.5. Jifunze kwa nini mzunguko mmoja wa Claude Code hutumia token 80,000 na kwa nini dakika tano za kutofanya kazi huongeza gharama.

Token ni nini ndani ya Claude?

Token ni kipimo cha maandishi ambacho Claude husoma na kuandika: ni sehemu ya neno, takriban herufi 3.5 za Kiingereza. Takwimu hiyo inatoka kwenye kamusi ya maneno ya Anthropic, na inafikia zaidi ya token moja kwa kila neno pindi nafasi na alama za uakifishaji zinapohesabiwa, kwa hivyo maneno elfu moja ya nathari yanazidi token 1,300. Msimbo (code) unatumia token nyingi zaidi kwa kila mstari: mabano, viendeshaji, alama za kusisitiza (underscores), na nafasi za mwanzoni mwa mstari hugawanywa katika token nyingi zaidi kwa kila herufi kuliko ilivyo katika Kiingereza, na faili ya msimbo yenye mistari mia chache kwa kawaida huwa na maelfu ya token. Faili yenye mistari 2,000 ambayo wakala (agent) anaamua kuisoma ni ununuzi wa token wa tarakimu tano kabla ya mtu yeyote kuandika mstari mmoja wa msimbo mpya.

Mambo mawili kuhusu tokenizers huwachanganya watu. Kwanza, ni mahususi kwa kila modeli. Kufikia Julai 2026, Opus 4.7 na matoleo mapya zaidi, Sonnet 5, na Fable 5 hutumia tokenizer mpya inayozalisha takriban 30% ya token nyingi zaidi kwa maandishi yale yale kuliko modeli za awali za Claude (ongezeko kamili hutofautiana kulingana na maudhui), jambo ambalo hubadilisha chochote ulichopangia bajeti ya token ingawa bei kwa kila token haikupanda pamoja na mabadiliko hayo. Pili, tiktoken, maktaba ambayo kila chapisho la blogu huirejelea, ni tokenizer ya OpenAI na hupunguza hesabu ya Claude kwa takriban 15–20% kwenye maandishi ya kawaida, na zaidi kwenye msimbo. Hesabu pekee inayoweza kuaminika ni ile ya endpoint ya count_tokens, inayoelezewa hapa chini.

Kwa nini gharama za kikao chako cha uandishi wa msimbo ziko hivyo

Kila ankara ya Claude, iwe ni ya API au kikomo cha usajili, inategemea kipimo kimoja: tokeni zinazoingia na tokeni zinazotoka. Ukurasa wa bei unaifanya ionekane rahisi: kiasi fulani cha dola kwa kila milioni ya tokeni zinazoingia, na kiasi fulani kwa kila milioni ya zile zinazotoka. Kile ambacho ukurasa huo haukuelezi ni kwamba katika kikao cha uandishi wa msimbo kwa kutumia wakala (agentic coding session), upande wa kuingiza data hufanya kazi kwa kasi kubwa zaidi kuliko unavyoweza kudhani, kwa sababu mazungumzo yote hutumwa upya katika kila hatua. Nimekuwa nikiuza miundombinu inayopimwa kwa matumizi kwa miaka kumi na mitano, na tokeni ndicho kipimo cha kwanza ambacho nimeona wateja wengi hawawezi kusema kwa hakika ni nini kinachokisababisha kiongezeke. Hili ndilo somo la usomaji wa kipimo: nini kinachohesabika kama ingizo na toleo katika kikao cha wakala, kwa nini mzunguko wa kutuma upya (resend loop) ni ghali sana, kwa nini prompt caching inabadilisha hesabu hizo, na ni vigezo vipi vinavyoweza kupunguza gharama hizo kwa uhalisia.

Kila kitu ni ingizo: kile ambacho mita huhesabu kihalisi

Watu hudhani wanalipia msimbo (code) unaoandikwa na Claude. Katika kipindi cha wakala (agentic session), hiyo ni sehemu ndogo ya gharama. Tokeni za ingizo (input tokens), ambazo zina bei nafuu lakini kwa ujazo mkubwa zaidi, zinajumuisha:

  • Prompt ya mfumo. Maelekezo ya msingi ya Claude Code, pamoja na CLAUDE.md yako na faili za kumbukumbu, hupakiwa mwanzoni mwa kipindi na huwepo katika kila ombi linalofuata.
  • Ufafanuzi wa zana (Tool definitions). Kila schema ya zana ambayo wakala anaweza kuiita. Kila seva ya MCP unayounganisha huongeza gharama hii ya kudumu, ingawa Claude Code sasa huahirisha ufafanuzi kamili wa zana za MCP kwa chaguo-msingi, hivyo majina ya zana pekee ndiyo yanayokaa kwenye muktadha hadi zana itumiwe kwa mara ya kwanza, jambo linalopunguza lakini haliondoi gharama hiyo.
  • Kila faili anayoisoma wakala. Read ya faili ya chanzo huweka faili nzima kwenye muktadha, na inabaki hapo.
  • Kila matokeo ya zana. Majaribio ya programu (test runs), matokeo ya grep, maandishi ya terminal, logi za ujenzi (build logs), yote hayo hurudi kama tokeni za ingizo. Msururu wa majaribio yaliyofeli (failing test suite) yanayochapisha mistari 8,000 yamekutoza gharama sawa na kitabu kidogo.
  • Mazungumzo yote hadi sasa, yanayotumwa upya katika kila hatua. Hili linastahili sehemu yake yenyewe.

Gharama za kutuma tena data

Claude API haina hali (stateless). Haikumbuki kikao chako kati ya maombi, hakuna kinachokumbuka. Kwa hivyo, katika hatua ya 2, mteja hutuma hatua ya 1 pamoja na jibu lake na ujumbe wako mpya. Katika hatua ya 50, inatuma tena hatua ya 1 hadi 49, kila faili iliyosomwa, kila matokeo ya zana, kila diff, pamoja na hatua ya 50. Model husoma tena nakala nzima kila wakati, na kila token inayosomwa tena huhesabiwa kama input inayotozwa gharama.

Matokeo yake: gharama kwa kila hatua hukua takriban kwa mstari kulingana na urefu wa kikao, na gharama ya jumla ya kikao hukua takriban kwa mraba. Ujumbe uliogharimu nusu senti katika hatua ya 3 unaweza kugharimu mara ishirini zaidi katika hatua ya 60, kwa swali lilelile la mstari mmoja, kwa sababu linabeba mzigo wa hatua sitini. Hii ndiyo sababu kuu inayoelezea tiketi nyingi za "kwa nini bili yangu ilikuwa juu sana", na si tabia ya kipekee ya Claude; kila bidhaa ya LLM inayoonekana kuwa na hali (stateful) ni API isiyo na hali (stateless) yenye kitanzi cha kutuma tena data (resend loop) kwa nyuma.

Matokeo: unachokiona, pamoja na mchakato wa kufikiri usiouona

Tokeni za matokeo ndizo zinazogharimu zaidi, mara tano ya kiwango cha tokeni za kuingiza katika safu nzima ya bidhaa ($5/$25 kwenye Opus 4.8, $3/$15 kwenye Sonnet 5, $1/$5 kwenye Haiku 4.5, kuanzia Julai 2026). Matokeo yanajumuisha maandishi na msimbo unaozalishwa na Claude, pamoja na tokeni za kufikiri: mchakato wa ndani wa kimantiki ambao modeli hufanya kabla ya kutoa jibu. Mambo mawili ni muhimu hapa. Kufikiri kunatozwa kwa viwango vya matokeo na huhesabiwa dhidi ya max_tokens, ambapo majibu ya API yanayokufa kwa stop_reason: "max_tokens" na jibu lililokatwa mara nyingi humaanisha kuwa mchakato wa kufikiri umetumia bajeti yote kabla ya jibu kukamilika. Na kwenye modeli za sasa, muhtasari wa kimantiki unaweza usionyeshwe kabisa; Opus 4.8, Sonnet 5, na Fable 5 huuficha kwa chaguo-msingi, lakini mchakato wa kufikiri bado umetokea na bado unatozwa. Kitu kisichoonekana hakimaanishi kuwa ni cha bure.

Claude Code huwezesha mchakato wa kufikiri kwa kina (extended thinking) kwa chaguo-msingi kwa sababu huboresha kazi za hatua nyingi kwa kiwango kinachopimika, na bajeti ya chaguo-msingi inaweza kufikia makumi ya maelfu ya tokeni kwa kila ombi. Katika kazi rahisi, unaweza kupunguza kiwango hiki: punguza kiwango cha juhudi kwa kutumia /effort au katika /model, au rekebisha mipangilio ya kufikiri katika /config. Hiyo ni njia halisi ya kudhibiti gharama, si imani potofu.

Prompt caching inabadilisha hesabu

Prompt caching ndiyo sababu kitanzi cha kutuma tena (resend loop) hakifilisi kila mtu. API inaweza kuhifadhi sehemu ya awali ya prompt yako, system prompt, ufafanuzi wa zana, na historia ya mazungumzo, kisha kwenye ombi linalofuata ikayatoa kwa sehemu ndogo ya gharama. Kufikia Julai 2026, vizidishi ni: uandishi (write) kwenye cache unagharimu mara 1.25 ya kiwango cha msingi cha input (mara 2 kwa toleo la saa 1), na usomaji (read) kutoka kwenye cache unagharimu mara 0.1. Uandishi ni wa gharama ya juu; usomaji una punguzo la 90%. Usomaji mmoja tu unatosha kufidia gharama ya ziada ya uandishi wa dakika 5.

Claude Code inakusimamia caching, na katika kipindi cha kazi chenye afya, karibu sehemu yote ya resend kubwa hutolewa kutoka kwenye cache. Lakini cache ya kawaida hudumu kwa dakika tano tangu ilipotumika mara ya mwisho. Ukiondoka kwa ajili ya kahawa na kuchelewa, ukirudi na kutuma ujumbe, cache itakuwa imekwisha muda wake, na prefix nzima iliyokusanywa itaandikwa upya kwa gharama ya mara 1.25 badala ya kusomwa kwa mara 0.1. Katika kipindi cha token 150K, zamu hiyo moja ya baridi (cold turn) inagharimu zaidi ya zamu kumi na mbili za joto (warm turns). Hii ndiyo matokeo yasiyo ya kawaida ambayo ni muhimu kuyaelewa: mdundo wa kutokuwa na kazi kisha kuanza tena unaweza kugharimu zaidi ya kazi endelevu, kwa sababu kila pengo la kutokuwa na kazi linalozidi TTL hubadilisha zamu yako inayofuata kutoka usomaji wa bei nafuu kwenda uandishi wa gharama kubwa. Fanya kazi kwa vipindi; usitume ujumbe mmoja kila baada ya dakika kumi katika kipindi kikubwa cha kazi.

Ikiwa unaita API kutoka programu yako mwenyewe kwenye VPS, hupati haya yote bure, na kosa la kawaida la kujisababishia hasara ni kuingiza timestamp au request ID kwenye system prompt, jambo ambalo hubadilisha baiti za prefix katika kila ombi na kuzima caching kimyakimya. Ishara ya tatizo hili ni usage.cache_read_input_tokens kubaki kwenye sifuri licha ya maombi kuonekana sawa.

Mfumo, pamoja na mfano wa hesabu

Puuza mtu yeyote anayetoa kauli ya jumla kwamba "kikao kimoja kinagharimu $X." Gharama za vikao hutofautiana kwa kiasi kikubwa. Kinachozingatiwa ni mfumo huu:

turn cost = (uncached input      x base input price)
          + (cache writes        x 1.25 x base input price)
          + (cache reads         x 0.10 x base input price)
          + (output incl. thinking x output price)

session cost = sum over all turns

Mfano wa hesabu kwa kutumia Claude Opus 4.8, ambayo kufikia Julai 2026 inagharimu $5 kwa kila token milioni moja za input na $25 kwa kila milioni moja za output. Mzunguko wa katikati ya kikao wenye token 80,000 za muktadha uliokusanywa: 75,000 zimesomwa kutoka kwenye cache, 3,000 zimeandikwa upya, 2,000 ni input mpya isiyo kwenye cache, na 1,500 ni token za output ikijumuisha mchakato wa kufikiri.

  • Usomaji wa cache: 75,000 × $0.50/M = $0.0375
  • Uandikaji wa cache: 3,000 × $6.25/M = $0.019
  • Input isiyo kwenye cache: 2,000 × $5/M = $0.010
  • Output: 1,500 × $25/M = $0.0375

Takriban $0.10 kwa mzunguko mmoja; mizunguko hamsini kama hiyo itagharimu karibu $5. Sasa, mzunguko uleule baada ya cache kuisha muda wake: token zote 80,000 zinaandikwa upya kwa $6.25/M, jambo linalofanya gharama kuwa $0.50 kabla ya output, karibu mara tano ya gharama ya mzunguko uliokuwa na cache, kwa kazi ileile. Tofauti hiyo ndiyo kiini cha umuhimu wa caching. Mistari hiyo minne ndiyo njia pekee ya kweli ya kulinganisha watoa huduma, kwa sababu bei za kawaida hupuuza usomaji wa cache na gharama za kufikiri, na kuzitumia kwenye kazi tatu halisi huonyesha mahali ambapo bili ya Claude inazidi au kupungua ikilinganishwa na ya OpenAI.

Ikiwa unataka kuelewa kitengo cha bili badala ya mzunguko mmoja, token milioni moja inawakilisha nini katika kurasa, faili, na dola hufanya hesabu ileile kwa kiwango cha juu zaidi. Kwa ajili ya makadirio badala ya utabiri: takwimu zilizochapishwa na Anthropic kwa ajili ya matumizi ya Claude Code kwenye makampuni, kufikia Julai 2026, ni wastani wa $13 kwa kila msanidi programu kwa siku ya kazi, $150–250 kwa mwezi, huku 90% ya watumiaji wakitumia chini ya $30 kwa siku. Gharama zako hutegemea chaguo la modeli, usimamizi wa vikao, na ukubwa wa codebase, ndiyo maana vigezo vilivyo hapa chini ni muhimu.

Kuangalia matumizi yako

Katika Claude Code, amri inayotumika ni /usage (/cost bado inafanya kazi, ni alias). Sehemu ya Session iliyo juu inaonyesha takwimu za token na makadirio ya gharama yaliyohesabiwa ndani ya kifaa kwa ajili ya session ya sasa; kwenye mipango ya usajili, skrini hiyo hiyo inaonyesha pau za kikomo cha mpango wako na uchanganuzi unaohusisha matumizi ya hivi karibuni na skills, subagents, plugins, na MCP servers binafsi. Kwa taarifa rasmi za malipo kwenye akaunti za API, ukurasa wa matumizi katika Claude Console ndio chanzo sahihi cha taarifa, takwimu ya CLI ni makadirio tu. /context huchora gridi ya rangi ya kinachojaza context window, system prompt, tools, ufafanuzi wa MCP, faili, historia, na ndiyo njia ya haraka zaidi ya kubaini CLAUDE.md iliyovimba au MCP server inayozungumza sana; tumia all ili kupanua uchanganuzi kamili wa kila kipengee.

Kutoka kwenye API, kila jibu hukuambia hasa kilichotokea:

response = client.messages.create(model="claude-sonnet-5", max_tokens=2048,
                                  messages=messages)
u = response.usage
total_prompt = u.input_tokens + u.cache_creation_input_tokens + u.cache_read_input_tokens
print(f"uncached={u.input_tokens} written={u.cache_creation_input_tokens} "
      f"read={u.cache_read_input_tokens} output={u.output_tokens}")

Kumbuka kuwa input_tokens ni salio lisilohifadhiwa kwenye cache pekee, ukubwa halisi wa prompt ni jumla ya sehemu zote tatu za input. Wakala aliyefanya kazi kwa saa moja akionyesha input_tokens: 4000 si wa bei nafuu; token nyingine 200,000 zilitolewa kutoka kwenye cache. Ili kukadiria kabla ya kutuma, tumia endpoint ya kuhesabu token, ni bure kupiga simu hiyo, ina kikomo chake cha kasi, na huhesabu kwa kutumia tokenizer ya modeli yoyote unayotaja (chukulia matokeo kama makadirio ya karibu; malipo huakisi ombi halisi):

count = client.messages.count_tokens(model="claude-sonnet-5",
                                     messages=[{"role": "user", "content": big_file}])
print(count.input_tokens)

Usiwahi kutumia tiktoken, kwa sababu iliyotajwa hapo juu.

Mipango ya usajili dhidi ya malipo kulingana na matumizi

Mbinu za kiufundi katika mwongozo huu ni sawa kila mahali; ni njia ya malipo pekee ndiyo inayotofautiana. Ukiwa na API key, Anthropic hutoza malipo kulingana na matumizi, kwa kila token, kulingana na viwango vilivyochapishwa, na kila namba iliyo hapo juu inawakilisha pesa halisi. Kipimo hicho huanza mapema kuliko watu wengi wanavyotarajia, kwa sababu hakuna tier ya bure ya kutegemea, bali ni mkopo mdogo tu wakati wa kujiandikisha na idadi ndogo ya endpoints zisizotoza chochote, ambacho ndicho kile ambacho akaunti mpya ya API hupata kabla hujaweka kadi ya malipo. Katika usajili wa Claude (Pro, Max, Team, Enterprise), matumizi ya Claude Code huchotwa kutoka kwa posho iliyojumuishwa kwenye mpango wako: kufikia Julai 2026, hiyo ni dirisha la matumizi ya saa tano linalojirudia pamoja na dirisha la kila wiki, linaloshirikiwa kati ya mifano mbalimbali na mazungumzo ya claude.ai, na kiasi cha dola cha /usage ni cha taarifa tu na si ankara ya malipo. Ukimaliza dirisha la matumizi utaona "You've hit your session limit" au "You've hit your weekly limit" pamoja na muda wa kurejesha upatikanaji, na kubadilisha mifano kwa kutumia /model hakutarejesha uwezo wa kutumia, kwa sababu madirisha hayo yanashirikiwa kati ya mifano yote. Madirisha hayo hufuata akaunti badala ya mteja unayemtumia wakati huo, jambo ambalo ni muhimu kulijua ikiwa bado unatafuta nini kinachofanya kazi kiasili kwenye Linux na ni mpango upi unaofunika kila eneo. Ni lipi kati ya madirisha hayo mawili ambalo umelimaliza ndilo huamua muda wa kusubiri na nini cha kufanya wakati huo, kwa hivyo ni vyema kujua chaguo zako unapofikia kikomo katikati ya kazi. Mipango inaweza kuwezesha mikopo ya matumizi kwa hiari, inayodhibitiwa na /usage-credits, ili kununua matumizi zaidi ya kikomo hicho. Kwa makusudi sitachapisha viwango vya mipango: ndizo namba zinazobadilika zaidi katika mada hii yote, kwa hivyo angalia claude.com/pricing na pau zako za /usage badala yake. Mbinu za token bado ni muhimu katika usajili, kikao cha matumizi mabaya hutumia dirisha lako kama vile ambavyo kingetumia dola. Kwa upande wa usajili, angalia ni mpango upi wa Claude unaofaa matumizi yako.

Mbinu zinazofanya kazi kweli

  • Punguza wigo wa kile wakala anachosoma. "Rekebisha hitilafu ya validation katika auth.py" inasoma faili moja; "boresha codebase hii" inasoma faili arobaini. Weka CLAUDE.md ikiwa fupi, kwa sababu inapakizwa katika kila session, hivyo iweke kwa mambo muhimu pekee, na uhamishe maelekezo mahususi ya workflow kwenye skills zinazopakizwa pale tu zinapohitajika.
  • Kuwa wazi na fupi. /clear kati ya kazi zisizohusiana, muktadha wa zamani hutumwa tena, na kulipiwa, katika kila ujumbe unaofuata. Ndani ya kazi moja ndefu, /compact Focus on the failing tests and the diff hufupisha historia na kukuweka mbali na ongezeko kubwa la gharama za token.
  • Chagua ukubwa sahihi wa model. Sonnet inashughulikia kazi nyingi za coding kwa $2/$10 kwa kila milioni ya token kwa bei ya utangulizi kuanzia Julai 2026 ($3/$15 bei ya kawaida, ikilinganishwa na Opus ya $5/$25), na Haiku kwa $1/$5 ndiyo zana sahihi kwa kazi za kiufundi za wakala mdogo kama vile kuchuja log. Fable 5 iko upande mwingine kwa $10/$50, mara mbili ya Opus kwa pande zote mbili za kipimo, kwa hivyo ni vyema kujua kazi zipi zinahalalisha gharama hiyo kabla ya kuiacha ikiwa imechaguliwa kwa kazi za kawaida. /model hubadilisha katikati ya session.
  • Chuja mapema matokeo marefu. Hook inayotumia grep kupunguza matokeo ya test hadi kubaki na hitilafu pekee kabla Claude hajaiona, hubadilisha token 20,000 za matokeo ya zana kuwa 300, na hufanya hivyo katika kila utumaji upya wa hatua hiyo.
  • Fanya kazi kwa kundi kwa yale yasiyo ya maingiliano. Kwa API pipelines zako, classification, uhakiki wa jumla, na kazi za usiku, Batches API huendesha model zilezile kwa punguzo la 50% kwa kubadilishana na utoaji wa matokeo kwa njia isiyo ya moja kwa moja (asynchronous).
  • Heshimu saa ya cache. Fanya kazi katika vipindi endelevu. Claude Code session iliyo katika tmux kwenye VPS haigharimu chochote ikiwa haitumiki, token hutumika tu wakati hatua inapoendeshwa, lakini cache iliyopata joto ndiyo inayopotea wakati wa kutofanya kazi, na hatua inayofuata italipia uandishi upya.

FAQ

Kikao cha uandishi wa code katika Claude Code hutumia token ngapi?

Hakuna idadi maalum. Mzunguko mmoja wa katikati ya kikao mara nyingi hubeba makumi ya maelfu ya token za prompt pindi faili na historia zinapokusanyika. Kikao cha kazi kinaweza kufikia mamilioni ya token, ambazo nyingi hutolewa kutoka kwenye cache kwa sehemu ya kumi ya gharama ya kawaida. Kwa ajili ya makadirio, takwimu za kibiashara zilizochapishwa na Anthropic kufikia Julai 2026 zinaonyesha wastani wa $13 kwa kila msanidi programu kwa siku ya kazi, huku 90% ya watumiaji wakitumia chini ya $30. Tekeleza /usage katika kikao chako; dakika tano za kufuatilia matumizi hayo ni bora kuliko wastani wowote uliochapishwa.

Je, token za kufikiri (thinking tokens) hugharimu pesa hata nisipoziona?

Ndiyo. Token za kufikiri hutoziwa kama token za pato (output tokens), ambazo zina gharama kubwa, na huhesabiwa dhidi ya max_tokens. Mifano ya sasa hutoza token hizi hata kama kiolesura hakionyeshi muhtasari wa hoja hizo. Ikiwa jibu litakatika na kuonyesha stop_reason: "max_tokens" kabla ya jibu linaloonekana kukamilika, inaelekea kuwa mchakato wa kufikiri umetumia bajeti yote. Katika Claude Code, punguza kiwango cha juhudi kwa kutumia /effort kwa kazi zisizohitaji uchambuzi wa kina.

Kwa nini kikao kirefu cha Claude Code huwa ghali zaidi kwa kila ujumbe?

Kwa sababu API haina hali (stateless): kila mzunguko hutuma tena mazungumzo yote, kila faili iliyosomwa, matokeo ya zana, na mabadilishano ya awali kama input inayotozwa. Hivyo, mzunguko wa 50 hubeba mizigo ya mizunguko 1 hadi 49. Prompt caching hutoa sehemu inayojirudia kwa takriban sehemu ya kumi ya bei ya kawaida ya input, lakini sehemu hiyo ya awali inaendelea kukua. Pengo lolote la kutofanya kazi linalozidi muda wa kuishi wa cache (TTL) hubadilisha mzunguko unaofuata kuwa uandishi upya wa bei kamili. /compact hupunguza historia; /clear huifuta kabisa.

Ninawezaje kuangalia matumizi yangu ya token na gharama za Claude?

Katika Claude Code, /usage huonyesha takwimu za token za kikao, makadirio ya gharama ya ndani, na pau za kikomo cha mpango wa usajili (/cost ni jina mbadala); /context huonyesha kile kinachojaza dirisha la muktadha. Kwa bili rasmi ya API, tumia ukurasa wa matumizi katika Claude Console. Katika code yako mwenyewe, soma response.usage; kujumlisha input_tokens, cache_creation_input_tokens, na cache_read_input_tokens kutakupa ukubwa halisi wa prompt. Fanya makadirio mapema kwa kutumia endpoint ya count_tokens, kamwe usitumie tiktoken.