SSD Nodes Learn RAM 8GB — $66/mwaka
Mwongozo Matt ConnorNa Matt Connor

Tokeni 1M za Claude hugharimu kiasi gani?

Jifunze bei ya tokeni milioni 1 za ingizo na towe katika Claude, kwa nini towe hugharimu mara 5 zaidi, na jinsi ya kukokotoa bili yako ya kila mwezi.

1M tokens hugharimu kiasi gani katika Claude?

1M tokens inamaanisha tokens milioni moja. Hiki ndicho kipimo kinachotumiwa kutangaza bei ya kila Claude API (application programming interface). Hakuna bei moja pekee, kwa sababu tokens za ingizo na za towe hutozwa kwa viwango tofauti, na kila modeli ina jozi yake ya viwango. Kufikia August 2026, tokens za ingizo milioni moja hugharimu $1 kwenye Claude Haiku 4.5, $2 kwenye Claude Sonnet 5, na $5 kwenye Claude Opus 5.

Towe ndilo sehemu ghali zaidi. Kwenye kila modeli ya sasa, kiwango cha towe ni mara tano ya kiwango cha ingizo. Kwa hiyo, uwiano kati ya mawili hayo huamua bili yako zaidi kuliko bei kuu iliyoonyeshwa. Programu inayotuma hati ndefu na kurudisha majibu mafupi hufanya kazi kwa gharama tofauti sana na programu inayoandika majibu marefu kutoka kwenye prompt fupi.

Ukurasa huu unaeleza uchumi wa vipimo: token hugharimu kiasi gani na jinsi ya kukadiria bili kabla ya kuunda programu. Ili kujua tokens hutumika wapi unapofanya kazi, soma tokens hutumika wapi ndani ya kipindi cha Claude Code.

Tokeni 1M zinavyoonekana

Tokeni ni kipande cha maandishi ambacho modeli husoma au kuandika. Mwongozo wa makadirio wa Anthropic ni tokeni 1 kwa kila vibambo 4, au takriban maneno 0.75 ya Kiingereza. Kwa hiyo, tokeni milioni 1 ni takriban maneno 750,000, au karibu 4 MB za maandishi yasiyoumbizwa.

Makadirio yaliyochapishwa kwa ingizo za kawaida yanaonyesha vizuri zaidi ukubwa huo.

ChartApproximate input token counts for common content, published estimates
The data behind this chart
[
  {
    "label": "Average web page (10 kB)",
    "tokens": "2,500"
  },
  {
    "label": "Documentation page (100 kB)",
    "tokens": "25,000"
  },
  {
    "label": "Research paper PDF (500 kB)",
    "tokens": "125,000"
  }
]

Kwa viwango hivyo, tokeni 1M ni takriban kurasa 400 za wastani za wavuti zinazosomwa mara moja, au makala 8 za utafiti zenye ukubwa huo. Ni uchakataji mmoja wa codebase ya ukubwa wa kati, au matumizi mepesi ya mazungumzo kwa mwezi mmoja kwa mtu mmoja.

Chukulia yote hayo kuwa makadirio. Code, JSON na maandishi katika lugha nyingine isipokuwa Kiingereza huweka maneno machache zaidi ndani ya tokeni moja, kwa hiyo uwiano wa 0.75 ni makadirio yenye matumaini. Kuna jambo lingine linalobadilisha hesabu: Claude Opus 4.7 na matoleo ya baadaye, yanayojumuisha Opus 5 na Sonnet 5, hutumia tokenizer mpya inayozalisha takriban tokeni 30 percent zaidi kwa maandishi yale yale kuliko Sonnet 4.6 na matoleo ya awali. Claude Haiku 4.5 hutumia tokenizer ya zamani. Kwa hiyo, hesabu uliyopima kwenye Haiku 4.5 itakuwa chini kuliko hesabu kwenye Sonnet 5 kwa ingizo linalofanana, ambayo inamaanisha kuwa ulinganisho wa moja kwa moja wa bei kwa kila milioni katika mpaka huo si wa haki. Hesabu prompt ile ile dhidi ya modeli zote mbili kabla ya kufanya uamuzi.

Claude hutoza kiasi gani kwa kila tokeni milioni

ChartClaude API list price in USD per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5
  },
  {
    "label": "Sonnet 5 (to 31 Aug 2026)",
    "input_usd": 2,
    "output_usd": 10
  },
  {
    "label": "Sonnet 5 (from 1 Sep 2026)",
    "input_usd": 3,
    "output_usd": 15
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25
  }
]

Claude Sonnet 5 inatumia bei ya utangulizi ya $2 kwa tokeni za ingizo na $10 kwa tokeni za towe hadi 31 August 2026. Kuanzia 1 September 2026, kiwango cha kawaida kitatumika: $3 kwa tokeni za ingizo na $15 kwa tokeni za towe. Claude Opus 5 ina bei ya $5 na $25.

Viwango hubadilika. Chukulia kila namba kwenye ukurasa huu kuwa mfano wa kukokotoa wa August 2026, na uthibitishe namba za sasa kwenye ukurasa rasmi wa bei kabla ya kuidhinisha bajeti.

Urefu wa muktadha hauibadili kiwango. Kwenye Claude 4.6 na matoleo ya baadaye, dirisha kamili la muktadha la tokeni 1M hutozwa kwa bei ya kawaida. Kwa hiyo, ombi la tokeni 900,000 hugharimu kiasi sawa kwa kila tokeni na ombi la tokeni 9,000. Prompt ndefu hugharimu zaidi kwa sababu ina tokeni nyingi zaidi, na hakuna kiwango tofauti cha muktadha mrefu.

Hesabu inayosalia sahihi baada ya mabadiliko ya bei

Kila bili ina kuzidisha mara mbili na kujumlisha mara moja.

cost = (input_tokens  / 1,000,000) * input_rate
     + (output_tokens / 1,000,000) * output_rate

Imeandikwa kama msimbo unaoweza kuendesha:

INPUT_RATE = 2.00    # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00  # USD per million output tokens

def cost(input_tokens, output_tokens):
    return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000

print(f"{cost(4300, 400):.4f}")

Hii huchapisha 0.0126. Ombi linalotuma tokeni 4,300 za ingizo na kupokea tokeni 400 za matokeo hugharimu takribani senti 1.3 kwenye Sonnet 5. Weka viwango hivyo viwili katika sehemu moja ya msimbo wako. Bei inapobadilika, unahariri mistari miwili, na kila makadirio katika mfumo wako hubadilika pamoja nayo.

Makadirio ya mfano kwa programu halisi

Chukulia msaidizi wa usaidizi. Maelekezo yake ya mfumo na nyaraka za bidhaa zina jumla ya tokeni 4,000, na hutumwa kwa kila ombi moja kwa moja, kwa sababu Messages API haina hali ya kuhifadhi muktadha na modeli haikumbuki chochote kati ya miito. Swali la mtumiaji huongeza takribani tokeni 300. Jibu huwa na takribani tokeni 400. Hivyo, kila ombi lina tokeni 4,300 za ingizo na tokeni 400 za matokeo.

Tokeni milioni moja za ingizo zinatosha kwa takribani maombi 232 ya aina hiyo. Kwa maombi 1,000 kwa siku, programu hutumia tokeni milioni 4.3 za ingizo kila siku. Hivyo, “tokeni 1M” zinatosha kwa chini ya saa sita za trafiki.

ChartEstimated cost per 1,000 requests at 4,300 input and 400 output tokens
The data behind this chart
[
  {
    "label": "Opus 5, list rates",
    "cost_per_1k_usd": "31.50"
  },
  {
    "label": "Sonnet 5, list rates",
    "cost_per_1k_usd": "12.60"
  },
  {
    "label": "Sonnet 5, Batch API",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Haiku 4.5, list rates",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Sonnet 5, warm prompt cache",
    "cost_per_1k_usd": "5.40"
  }
]

Kwenye Claude Opus 5, trafiki hiyo hugharimu $31.50 kwa maombi 1,000. Kwenye Sonnet 5, hugharimu $12.60. Ukihamia Claude Haiku 4.5, gharama hushuka hadi $6.30, na cache ya prompt iliyo tayari kwenye Sonnet 5 hushusha gharama zaidi hadi $5.40.

Zidisha kwa 30 ili kupata gharama ya mwezi mmoja ya trafiki hiyo. Sonnet 5 kwa viwango vilivyochapishwa hugharimu takribani $378 kwa mwezi. Programu hiyo hiyo yenye cache iliyo tayari hugharimu takribani $162. Chaguo lako la modeli na uamuzi wako wa kutumia cache vina thamani kubwa kuliko punguzo lolote la bei utakalojadiliana kwa kiwango hiki cha matumizi. Modeli ya kuendesha ni suala tofauti. Chaguo la bei ya chini linalofaulu katika tathmini zako ndilo bora: kuchagua kati ya Opus, Sonnet na Haiku inaeleza jinsi ya kulijaribu ipasavyo.

Akiba ya prompt hupunguza sehemu inayojirudia

Kiambishi awali cha tokeni 4,000 kinafanana katika kila ombi, na unalipia bei kamili ya ingizo kila mara. Akiba ya prompt huhifadhi kiambishi awali kilichochakatwa na hutoza kiwango kilichopunguzwa unapokitumia tena.

Usomaji wa akiba hugharimu mara 0.1 ya kiwango cha msingi cha ingizo. Kuandika kwenye akiba hugharimu mara 1.25 ya msingi kwa muda wa kuhifadhi wa dakika 5, au mara 2 ya msingi kwa muda wa saa 1. Kwa hiyo, akiba ya dakika 5 hujilipia baada ya usomaji 1, kwa sababu uandishi hugharimu ziada ya 0.25 huku kila usomaji ukiokoa 0.9. Akiba ya saa 1 inahitaji usomaji 2 ili kufikia usawa wa gharama.

Njia rahisi zaidi ya kuiwasha ni kuweka sehemu moja ya kiwango cha juu:

curl https://api.anthropic.com/v1/messages \
  -H "content-type: application/json" \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "You are a helpful assistant.",
    "messages": [
      {"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
    ]
  }'

Kisha soma kizuizi cha usage kinachorejeshwa:

{
  "usage": {
    "cache_creation_input_tokens": 5120,
    "cache_read_input_tokens": 1800,
    "input_tokens": 50,
    "output_tokens": 503
  }
}

Kaunta hizo 3 za ingizo hutozwa kwa viwango 3 tofauti, na jumla yake ni ujazo wako halisi wa ingizo: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens. Makadirio ya gharama yanayosoma input_tokens pekee yatakuwa na makosa makubwa baada ya akiba kuwashwa.

Mambo 2 huzuia akiba isijilipie, na yote hushindwa bila kuonyesha hitilafu.

Kiambishi awali lazima kifanane kwa kila byte. Utafutaji wa akiba hulinganisha kiambishi awali, kwa hiyo muhuri wa muda au jina la mtumiaji mwanzoni mwa system prompt hubadilisha kiambishi hicho katika kila ombi. Kisha unalipa mara 1.25 ya msingi wa ingizo kila mara na husomi akiba hata mara 1. Dalili ni cache_creation_input_tokens kubaki juu huku cache_read_input_tokens ikibaki 0. Weka cache_control kwenye kizuizi cha mwisho ambacho maudhui yake yanafanana katika maombi yote, kisha uweke kila kinachobadilika baada yake. Kubadilisha ufafanuzi wako wa tools hubatilisha akiba yote iliyo chini yake, kwa sababu ubatilishaji hufuata mpangilio wa tools, kisha system, kisha messages.

Kiambishi awali lazima kiwe kirefu vya kutosha. Urefu wa chini wa kuweka kwenye akiba ni tokeni 512 kwenye Opus 5, 1,024 kwenye Sonnet 5 na 4,096 kwenye Haiku 4.5. Prompt fupi zaidi haiwekwa kwenye akiba, na hakuna hitilafu inayorejeshwa. Kiambishi awali cha tokeni 4,000 katika mfano hapo juu huwekwa kwenye akiba kwenye Sonnet 5, lakini hakiwekwi kwenye Haiku 4.5, kwa sababu 4,000 iko chini ya kiwango cha chini cha model hiyo. Kaunta zote 2 zikisoma 0, hakuna kilichowekwa kwenye akiba.

Uchakataji wa bechi hupunguza kiwango kwa nusu

API ya Batch huchakata maombi bila kusawazisha, kwa punguzo la asilimia 50 kwenye ingizo na towe. Katika mfano ulio hapo juu, hii hubadilisha $12.60 kwa kila maombi 1,000 kuwa $6.30. Punguzo hili hujumuishwa na uhifadhi wa prompt, hivyo kazi ya bechi iliyohifadhiwa ndiyo njia ya gharama ya chini zaidi ya kuendesha kazi nyingi.

Unachopoteza ni muda wa kusubiri. Hivyo, bechi haifai kwa kazi ambayo mtu anakaa na kusubiri matokeo. Inafaa kwa uainishaji wa usiku na kujaza tena nyaraka zilizokosekana.

Kwa nini gharama ya mazungumzo huongezeka ndani ya mazungumzo moja

Kwa sababu API haihifadhi hali, mteja wako hutuma tena mazungumzo yote katika kila zamu. Kwa hiyo, matumizi ya tokeni ndani ya mazungumzo moja huongezeka kulingana na mraba wa urefu wake, si kwa mstari wa moja kwa moja.

Chukulia zamu zenye wastani wa tokeni 500. Zamu ya 1 hutuma tokeni 500 za ingizo. Zamu ya 2 hutuma 1,000. Zamu ya 20 hutuma 10,000. Ukijumlisha kwa kutumia n(n+1)/2, mazungumzo yenye zamu 20 yatakuwa yametuma takribani tokeni 105,000 za ingizo, ingawa nakala ya mazungumzo yenyewe ina urefu wa tokeni 10,000 tu.

Ndiyo maana kipengele cha mazungumzo hugharimu zaidi ya inavyoonyesha nakala yake, na kwa nini kuweka akiba ya kiambishi awali kisichobadilika au kufanya muhtasari wa zamu za zamani hujilipa katika nyuzi ndefu. Agent anayezunguka kwenye miito ya zana ana muundo huo huo, na hali huwa mbaya zaidi: kila matokeo ya zana hubaki kwenye historia na hutumwa tena katika kila zamu inayofuata. Kuweka kikomo cha matumizi kwa agent unayoiendesha mwenyewe ni muhimu zaidi hapa, kwa sababu ongezeko hilo hutokea kiotomatiki na hakuna anayelifuatilia.

Hesabu tokeni kabla ya kukisia

Acha kukadiria idadi ya tokeni kutokana na idadi ya maneno. API inakuhesabia tokeni hizo bila malipo, kwa kikomo cha kasi kilicho tofauti na uundaji wa ujumbe.

curl https://api.anthropic.com/v1/messages/count_tokens \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "content-type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "system": "You are a scientist",
    "messages": [{
      "role": "user",
      "content": "Hello, Claude"
    }]
  }'

Jibu lina sehemu moja:

{ "input_tokens": 14 }

Ipe system prompt na ufafanuzi wa zana zako halisi, pamoja na ujumbe wa mtumiaji unaowakilisha matumizi ya kawaida, kisha weka nambari hiyo kwenye kitendakazi cha gharama kilicho hapo juu. Endpoint hutumia body ileile kama ombi la ujumbe, kwa hiyo picha na PDFs pia huhesabiwa kwa usahihi. Kuna tahadhari mbili muhimu. Hesabu hiyo ni makadirio na inaweza kutofautiana kidogo na thamani inayotozwa. Pia hupimwa kwa tokenizer ya model unayopitisha, kwa hiyo pitisha model utakayoendesha kwa kweli.

Tokeni za matokeo haziwezi kuhesabiwa mapema, kwa sababu bado hazipo. Ziweke kikomo kwa max_tokens, kisha pima mgawanyo halisi kutoka usage.output_tokens kwenye traffic ya moja kwa moja.

Gharama nyingine zinazoingia kwenye bili

Tokeni ndizo sehemu kubwa ya bili. Kuna vipengele vichache ambavyo si tokeni, na huwashangaza watu.

  • Ufafanuzi wa zana hubadilika kuwa tokeni za ingizo katika kila ombi. Prompt ya mfumo wa matumizi ya zana pekee huongeza tokeni 286 hadi 406 kwenye Opus 5, kabla ya schema zako mwenyewe. Ufafanuzi kumi wa zana wenye maneno mengi unaweza kuifanya prompt ndogo iwe na ukubwa mara mbili.
  • Utafutaji wa wavuti hutozwa $10 kwa kila utafutaji 1,000, pamoja na tokeni zinazotumiwa na matokeo yanapoingia kwenye muktadha.
  • Web fetch haina ada yake yenyewe, lakini ukurasa uliopakuliwa huwa tokeni za ingizo. Ukurasa wa nyaraka wenye ukubwa wa 100 kB una takriban 25,000 kati ya hizo.
  • Kuomba inference ya Marekani pekee kwa kutumia inference_geo kwenye Claude 4.6 na matoleo ya baadaye hutumia kizidishi cha 1.1 kwa kila aina ya tokeni, ikijumuisha usomaji na uandishi wa akiba.

Iwapo API ndiyo chaguo sahihi la kununua hutegemea kiasi cha matumizi yako. Chini ya kiwango fulani cha matumizi, mpango wa kila mwezi wenye ada maalum huwa bora moja kwa moja, na ulinganisho wa API na usajili wa Claude hufanya ulinganisho huo kwa kutumia nambari halisi.

FAQ

Tokeni 1M hugharimu kiasi gani katika Claude?

Inategemea modeli, na pia ikiwa tokeni ni za ingizo au za towe. Kufikia Agosti 2026, tokeni milioni moja za ingizo hugharimu $1 kwenye Claude Haiku 4.5, $2 kwenye Claude Sonnet 5 kwa bei ya utangulizi, na $5 kwenye Claude Opus 5. Gharama ya towe ni mara tano ya kiwango cha ingizo kwenye kila moja ya modeli hizo. Sonnet 5 itabadilika kuwa $3 kwa ingizo na $15 kwa towe tarehe 1 Septemba 2026. Viwango hubadilika, kwa hiyo vithibitishe kwenye ukurasa rasmi wa bei kabla ya kuweka kiasi kwenye bajeti.

Je, tokeni 1M ni sawa na maneno 1M?

Hapana. Tokeni moja ina takribani vibambo 4 vya Kiingereza, au takribani maneno 0.75, kwa hiyo tokeni milioni moja ni karibu maneno 750,000. Uwiano huo ni mwongozo tu. Code, JSON na lugha nyingine zisizo Kiingereza hutumia tokeni nyingi zaidi kwa kila neno. Claude Opus 4.7 na matoleo ya baadaye pia hutumia tokenizer mpya inayozalisha takribani tokeni 30 zaidi kwa kila maandishi yanayofanana kuliko Claude Sonnet 4.6 na matoleo ya awali, kwa hiyo hesabu hazihamishiki kati ya vizazi vya modeli. Pima kwa kutumia endpoint ya bure /v1/messages/count_tokens, ukipitisha modeli unayopanga kuendesha.

Je, prompt caching huokoa pesa kila wakati?

Hapana. Kuandika cache ya dakika 5 hugharimu mara 1.25 ya kiwango cha msingi cha ingizo, kwa hiyo prefix inayoandikwa lakini haisomwi kamwe hugharimu zaidi kwa asilimia 25 kuliko kuituma bila cache. Inajilipia kuanzia usomaji wa kwanza. Hushindwa kwa njia mbili, bila kutoa taarifa. Ikiwa prefix iliyohifadhiwa kwenye cache inabadilika kati ya maombi, utafutaji haulingani kamwe, kwa sababu ulinganifu wa prefix ni kamili. Ikiwa prefix ni fupi kuliko urefu wa chini unaoruhusiwa na modeli kwa kuhifadhiwa kwenye cache, ambao ni tokeni 1,024 kwenye Sonnet 5 na 4,096 kwenye Haiku 4.5, hakuna kinachohifadhiwa na hakuna hitilafu inayorejeshwa. Wakati cache_creation_input_tokens na cache_read_input_tokens zote zinasoma 0, cache haifanyi kazi yoyote.

Kwa nini bili yangu ilikua haraka kuliko idadi ya ujumbe?

Kwa sababu mazungumzo yote hutumwa tena katika kila zamu. Messages API haihifadhi hali, kwa hiyo zamu ya 20 ya mazungumzo hubeba tena zamu zote 19 zilizotangulia kama ingizo. Zamu zikiwa na wastani wa tokeni 500, mazungumzo ya zamu 20 hutuma takribani tokeni 105,000 za ingizo, ilhali nakala ya mazungumzo ina urefu wa tokeni 10,000 tu. Mizunguko ya agent hufanya vivyo hivyo, kwa kuwa kila matokeo ya zana hubaki kwenye historia. Hifadhi prefix thabiti kwenye cache, au fupisha zamu za zamani na uziondoe kwenye ombi.

#claude#tokens#api-pricing#cost-estimation#prompt-caching