SSD Nodes Learn 🎉 VPS kutoka $5.50/mwezi
Mwongozo Matt ConnorNa Matt Connor · Imeboreshwa 2026-08-13

Gharama za token za Claude: Kwa nini output ni ghali?

Gundua kwa nini token za matokeo ya Claude zinagharimu mara tano zaidi ya ingizo. Tunachambua tofauti kati ya prefill na decoding na athari zake kwenye bili yako ya kila mwezi.

Kwa nini token za matokeo (output) zina gharama kubwa kuliko token za ingizo (input)

Token za matokeo zina gharama mara tano ya token za ingizo kwenye kila modeli ya Claude katika orodha ya sasa. Sababu ni muundo wa hesabu (computation). Kusoma prompt ni hatua moja ya kupitia modeli. Kuandika jibu ni hatua moja kwa kila token, na kila hatua lazima isubiri ile iliyotangulia.

Uwiano huo ni sawa kwenye kila mstari wa orodha ya bei, kwa hivyo modeli unayochagua haibadilishi kiasi cha bili yako kinachotokana na matokeo. Muundo wa kazi yako ndio unaoamua hilo. Hatua ya wakala (agent step) inayosoma token 60,000 na kujibu kwa 800 haitumii karibu chochote kwa matokeo. Kazi ya kuandaa rasimu inayosoma token 2,000 na kuandika 12,000 haitumii karibu chochote kwa ingizo. Kesi zote mbili zimefanyiwa hesabu hapa chini kulingana na viwango vya Anthropic vilivyochapishwa mnamo Agosti 2026.

Prefill huendeshwa mara moja, decoding huendeshwa mara moja kwa kila token

Seva ya inference hushughulikia ombi katika hatua mbili zenye gharama tofauti sana. Prefill husoma prompt. Decoding huandika jibu.

Prefill huchukua prompt nzima kwa wakati mmoja. Kila token ya prompt huingia kwenye mtandao katika forward pass moja, hivyo kazi ya attention na feed-forward huwa idadi ndogo ya matrix multiplications kubwa zinazoshughulikia maelfu ya token kwa wakati mmoja. Usomaji mmoja wa model weights kutoka kwenye memory huhudumia prompt nzima. Matrix units za accelerator hubaki zikifanya kazi, jambo linalomaanisha kuwa prefill ni compute-bound: kikomo ni kasi ya chip katika kufanya multiplication.

Decoding haiwezi kufanya kazi kwa njia hiyo, kwa sababu token 2 inategemea token 1. Token ambayo model imetoa sasa inakuwa sehemu ya input kwa hatua inayofuata, hivyo hatua hizi haziwezi kuendeshwa kwa wakati mmoja. Kila output token hupata forward pass yake yenyewe, na kila pass kati ya hizo husoma seti nzima ya model weights kutoka kwenye high-bandwidth memory ili kutoa token moja. Hii hufanya decoding kuwa memory-bound: kikomo ni kasi ya kusafirisha weights, si kasi ya kuzizidisha. Trafiki ileile ya weights iliyotumia prompt nzima wakati wa prefill, hukupa token moja tu wakati wa decoding.

Mifumo ya kuhudumia (serving systems) hupambana na hali hii kwa kutumia batching. Maombi mengi hufanyiwa decoding pamoja, hivyo usomaji mmoja wa weights hutoa token moja kwa kila ombi lililo kwenye batch. Hiyo ndiyo sababu decoding inawezekana kiuchumi. Kikomo ni memory tena. Kila ombi linaloendelea hushikilia KV cache (key/value cache, hali ya attention iliyohifadhiwa kwa kila token hadi sasa), cache hiyo hukua kwa kila token inayozalishwa, na inapojaza accelerator, batch haiwezi kukua zaidi.

Hakuna kati ya hayo kinachokupa namba kamili, na hupaswi kuchukulia 5x kama uwiano uliopimwa wa vifaa (hardware ratio). Hiyo ni bei, iliyowekwa na Anthropic, ikizingatia asymmetry hiyo. Unachoweza kujikagua mwenyewe ni mwelekeo, na inachukua takriban dakika moja.

Pima pengo la ingizo na pato wewe mwenyewe

Sakinisha zana hizi kwenye mashine yoyote ya Ubuntu:

sudo apt update && sudo apt install -y curl jq moreutils

Sasa tiririsha prompt fupi inayoomba jibu refu, na uweke mhuri wa muda kila mstari unapofika.

curl -sN https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{"model":"claude-sonnet-5","max_tokens":1000,"stream":true,
       "messages":[{"role":"user","content":"Count from 1 to 300, one number per line."}]}' \
  | ts -s '%.s'

ts -s huweka kiambishi cha sekunde zilizopita tangu amri ilipoanza kwenye kila mstari. Kuna mambo mawili ya kuzingatia kutoka kwenye pato hilo. Mstari wa kwanza wa content_block_delta ni muda wako wa kupata token ya kwanza, na prefill yote ilitokea ndani yake. Kila mstari unaofuata ni hatua ndogo ya decoding, na mihuri ya muda huendelea kupanda hadi message_stop inapofika.

Sasa geuza umbo hilo. Weka hati ndefu kwenye prompt na uweke kikomo cha jibu kwa token chache.

curl -sN https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d "$(jq -n --rawfile doc ./long-document.txt \
       '{model:"claude-sonnet-5", max_tokens:16, stream:true,
         messages:[{role:"user", content:("Answer in one word. Is this document about networking?\n\n" + $doc)}]}')" \
  | ts -s '%.s'

Delta ya kwanza inachukua muda mrefu zaidi kuliko ilivyokuwa na prompt fupi, kwa sababu prefill ina maandishi mengi zaidi ya kusoma. Baada ya kufika, jibu huisha karibu mara moja, kwa sababu token chache tu zimebaki kwa ajili ya decoding. Makumi ya maelfu ya token yaliingia na saa haikusogea sana. Mamia machache yalitoka na saa ilikimbia muda wote.

Kila jibu lisilotiririka huishia na nambari unazotozwa ada.

{
  "usage": {
    "input_tokens": 41283,
    "output_tokens": 6,
    "cache_creation_input_tokens": 0,
    "cache_read_input_tokens": 0
  }
}

Hifadhi nyanja zote nne kwa kila ombi. output_tokens inajumuisha kufikiri kwa kina, kwa hivyo modeli inayofikiri kabla ya kujibu hutoza kufikiri huko kwa kiwango cha pato. Ili kupanga bei ya prompt kabla ya kuituma, POST /v1/messages/count_tokens inakubali mwili uleule wa ombi, inarudisha {"input_tokens": N} bila kuendesha modeli, na ni bure. Hiyo si sehemu pekee ya API isiyo na gharama, na sehemu zipi za Claude API hutozwi ada kamwe inafaa kuangaliwa kabla ya kupanga bajeti ya mradi wako wa kwanza.

Gharama za Claude kwa kila token milioni kufikia Agosti 2026

ChartClaude API list rates, US dollars per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5,
    "output_multiple": 5
  },
  {
    "label": "Sonnet 5 (to 31 Aug)",
    "input_usd": 2,
    "output_usd": 10,
    "output_multiple": 5
  },
  {
    "label": "Sonnet 5 (from 1 Sep)",
    "input_usd": 3,
    "output_usd": 15,
    "output_multiple": 5
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25,
    "output_multiple": 5
  },
  {
    "label": "Fable 5",
    "input_usd": 10,
    "output_usd": 50,
    "output_multiple": 5
  }
]

Safu ya mwisho ni matokeo yaliyogawanywa kwa pembejeo, na inaonyesha 5 katika kila mstari. Haiku 4.5 inatoza $1 kwa pembejeo na $5 kwa matokeo. Opus 5 inatoza $5 na $25. Fable 5, ambayo ni ghali zaidi, inatoza $10 na $50, na kile ambacho viwango hivyo vya Fable 5 vinakupa kinastahili kusomwa kabla ya kuipuuza safu hiyo ya juu. Kupanda katika viwango hivyo huzidisha pande zote mbili kwa kiasi kilekile, hivyo hubadilisha jumla yako lakini huacha uwiano wa pembejeo kwa matokeo ukiwa pale pale.

Sonnet 5 inaonekana mara mbili kwa sababu kiwango chake cha utangulizi kinaisha muda wake. Hadi tarehe 31 Agosti 2026 inatoza $2 na $10. Kuanzia tarehe 1 Septemba 2026, kiwango cha kawaida cha $3 na $15 kitatumika, ambacho ni ongezeko la 50% kwa pande zote mbili. Kila mfano wa kazi hapa chini unatumia kiwango cha Agosti.

Viwango hubadilika, na ukurasa huu si mahali unapaswa kuvikagua. claude.com/pricing ndiyo chanzo cha uhakika. Kinachobaki baada ya mabadiliko ya bei ni mbinu.

Kuna tahadhari moja ambayo orodha ya bei haionyeshi. Nyaraka za Anthropic zinaeleza kuwa Claude 4.7 na mifano ya baadaye hutumia tokenizer mpya inayozalisha takriban 30% ya token nyingi zaidi kwa maandishi yaleyale kuliko tokenizer iliyotumika katika Sonnet 4.6 na matoleo ya awali. Mifano miwili ikilinganishwa kwa bei ya kila token milioni pekee itapendelea mfano mpya, kwa sababu hati ileile inakuwa na token nyingi zaidi kwenye mfano huo. Linganisha kwa gharama ya kila kazi iliyokamilika, na hesabu prompts zako halisi dhidi ya mfano unaopanga kutumia. thamani ya token milioni moja za Claude katika maandishi halisi inaelezea jinsi kiasi hicho kinavyoonekana katika matumizi ya kawaida.

Ni lini gharama ya output inaanza kutawala bili yako?

Kwa kuwa bei ya output ni 5 ya bei ya input, ni rahisi kukokotoa sehemu ya usawa (break-even) kichwani. Tuseme token za input ni I na token za output ni O. Gharama ya input ni I. Gharama ya output ni mara 5 ya O. Output inachukua nusu ya matumizi yako wakati 5 mara O ni kubwa kuliko I, ambayo ni uwiano wa token 5 za input kwa 1 ya output.

Kwa hivyo, ikiwa prompt yako ni ndefu zaidi ya mara tano ya jibu lako, input ndiyo gharama kubwa zaidi. Chini ya hapo, output ndiyo gharama kubwa.

ChartShare of spend by input to output token ratio, at 5x output pricing
The data behind this chart
[
  {
    "label": "100:1",
    "input_share_pct": 95.2,
    "output_share_pct": 4.8
  },
  {
    "label": "75:1",
    "input_share_pct": 93.75,
    "output_share_pct": 6.25
  },
  {
    "label": "20:1",
    "input_share_pct": 80,
    "output_share_pct": 20
  },
  {
    "label": "10:1",
    "input_share_pct": 66.7,
    "output_share_pct": 33.3
  },
  {
    "label": "5:1",
    "input_share_pct": 50,
    "output_share_pct": 50
  },
  {
    "label": "1:1",
    "input_share_pct": 16.7,
    "output_share_pct": 83.3
  },
  {
    "label": "1:6",
    "input_share_pct": 3.2,
    "output_share_pct": 96.8
  }
]

Katika uwiano wa 100 kwa 1, output inachukua 4.8% ya matumizi, na kupunguza prompt ndiyo kazi pekee yenye manufaa. Katika uwiano wa 5 kwa 1, pande zote mbili zinalingana. Katika uwiano wa 1 kwa 6, output inachukua 96.8% na prompt inakuwa kiasi kidogo kisicho na athari kubwa. Watu wengi hukisia uwiano wao vibaya, kwa hivyo ichukue kutoka kwenye logs zako kabla ya kufanya uboreshaji wowote.

Mzigo wa kazi wa wakala: muktadha mrefu wa kuingiza, jibu fupi la kutoa

Chukua hatua moja ya wakala wa utafutaji: token 60,000 za hati zilizorejeshwa na historia ya mazungumzo kama ingizo, na jibu la token 800. Hiyo ni uwiano wa 75 kwa 1, jambo la kawaida kwa mfumo wowote unaosoma kabla ya kuandika.

ChartOne agent step, 60,000 input and 800 output tokens, US dollars per call
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_cost": 0.06,
    "output_cost": 0.004,
    "total_cost": 0.064
  },
  {
    "label": "Sonnet 5 (Aug)",
    "input_cost": 0.12,
    "output_cost": 0.008,
    "total_cost": 0.128
  },
  {
    "label": "Opus 5",
    "input_cost": 0.3,
    "output_cost": 0.02,
    "total_cost": 0.32
  },
  {
    "label": "Fable 5",
    "input_cost": 0.6,
    "output_cost": 0.04,
    "total_cost": 0.64
  }
]

Matokeo ni 6.25% ya gharama ya wito huo kwenye kila modeli, kwa sababu uwiano huu haubadiliki katika orodha nzima ya bei. Wito huo unagharimu $0.32 kwenye Opus 5, $0.128 kwenye Sonnet 5 kwa viwango vya Agosti, na $0.064 kwenye Haiku 4.5. Hatua mia mbili za aina hiyo kwa siku kwenye Opus 5 ni $64 kwa siku.

Njia ya kuokoa gharama huwa wazi pindi unapoona mgawanyo huu. Kupunguza jibu kutoka token 800 hadi 400 huokoa takriban 3% ya gharama ya wito. Kuondoa token 20,000 za muktadha usio na umuhimu kutoka kwenye prompt huokoa takriban theluthi moja ya gharama. Kupunguza urefu wa matokeo kwenye wakala anayesoma sana ni jitihada zisizo na tija kubwa. mahali ambapo token za wakala wa programu huenda huchanganua kile kinachojaza prompt hiyo hapo awali.

Uzalishaji wa kazi: maelekezo mafupi, rasimu ndefu

Sasa badilisha muundo. Maelekezo ya token 2,000, rasimu ya token 12,000, uwiano wa 1 kwa 6.

ChartOne draft, 2,000 input and 12,000 output tokens, US dollars per draft
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_cost": 0.002,
    "output_cost": 0.06,
    "total_cost": 0.062,
    "batch_total_cost": 0.031
  },
  {
    "label": "Sonnet 5 (Aug)",
    "input_cost": 0.004,
    "output_cost": 0.12,
    "total_cost": 0.124,
    "batch_total_cost": 0.062
  },
  {
    "label": "Opus 5",
    "input_cost": 0.01,
    "output_cost": 0.3,
    "total_cost": 0.31,
    "batch_total_cost": 0.155
  },
  {
    "label": "Fable 5",
    "input_cost": 0.02,
    "output_cost": 0.6,
    "total_cost": 0.62,
    "batch_total_cost": 0.31
  }
]

Matokeo ni 96.8% ya gharama hii. Opus 5 inagharimu $0.31 kwa kila rasimu dhidi ya $0.062 kwenye Haiku 4.5. Tofauti hiyo ya mara tano inatokana karibu yote na upande wa matokeo, ambapo ndipo mfano wa bei nafuu hukupa akiba kubwa zaidi.

Safu ya mwisho ni kazi ileile kupitia Batch API, ambayo hupunguza gharama za input na output kwa 50%. Opus 5 inashuka hadi $0.155 kwa kila rasimu. Batch hurejesha matokeo ndani ya saa 24 badala ya papo hapo, hivyo inafaa kwa uzalishaji wa ripoti za usiku na uainishaji wa wingi. Haifai kwa kazi yoyote ambayo mtu anasubiri kwa ajili ya kuendelea.

Uelekezaji wa modeli (model routing) unalipa hapa kwa njia ambayo haifanyiki kamwe kwenye hatua ya wakala. Ikiwa sehemu ndefu ya kazi ni ya kiufundi, kama vile kupangilia upya maandishi au kupanua muhtasari uliokwisha kuidhinisha, modeli ya bei nafuu huzalisha token hizo kwa bei ya chini mara tano. kuchagua kati ya Opus, Sonnet na Haiku inaelezea mahali ambapo mstari wa ubora unapoanzia kihalisi.

Akiba ya cache hupunguza gharama za input pekee

Prompt caching huhifadhi sehemu ya awali ya prompt yako kwenye seva na kutoza sehemu ndogo ya bei ya input ili kuisoma tena. Kufikia Agosti 2026, vizidishi ni mara 1.25 ya bei ya kawaida ya input kwa ajili ya kuandika cache ya dakika 5, mara 2 kwa cache ya saa 1, na mara 0.1 kwa kusoma hit.

Output haijajumuishwa kwenye mpango huu. Hakuna output inayohifadhiwa kwenye cache. Kila token inayozalishwa na model hutozwa kwa bei kamili ya output, kila wakati, bila kujali ni kiasi gani cha prompt kilichopatikana kama cache hit.

Chukua hatua hiyo hiyo ya wakala kwenye Opus 5, ambapo token 55,000 kati ya 60,000 za input zimetoka kwenye cache iliyo tayari.

ChartThe same Opus 5 agent step, with and without a warm 55,000 token cache, US dollars
The data behind this chart
[
  {
    "label": "No cache",
    "input_cost": 0.3,
    "output_cost": 0.02,
    "total_cost": 0.32
  },
  {
    "label": "55k prefix cache read",
    "input_cost": 0.0525,
    "output_cost": 0.02,
    "total_cost": 0.0725
  }
]

Gharama ya ombi hilo inashuka kutoka $0.32 hadi $0.0725. Gharama ya output haibadiliki: $0.02 kabla, na $0.02 baada. Caching hupunguza bili na kubadilisha muundo wake. Output ilikuwa 6.25% ya ombi hilo. Sasa ni zaidi ya robo yake, jambo linalobadilisha kipaumbele cha hatua za kuchukua baadaye.

Ombi la kwanza hulipia gharama ya kuandika cache. Kuandika cache ya dakika 5 kunagharimu mara 1.25 ya bei ya msingi ya input, kwa hivyo hujilipia baada ya hit moja tu. Kuandika cache ya saa 1 kunagharimu mara 2, kwa hivyo inahitaji hits mbili. vizidishi vya kuandika na kusoma, na mahali ambapo caching huacha kuwa na faida hufafanua hesabu hiyo kwa kina.

Vigezo vinne unavyoweza kudhibiti

  1. Weka max_tokens kulingana na urefu wa matokeo yako ya p95, siyo upeo wa juu wa modeli.
  2. Elekeza hatua ndefu kwa modeli ya bei nafuu.
  3. Fanya batching kwa kazi yoyote ambayo hakuna anayoisubiri.
  4. Futa maelekezo yanayoongeza urefu wa majibu bila sababu.

max_tokens ni kikomo cha juu kabisa, na kukiweka juu hakugharimu chochote peke yake, kwa sababu unatozwa kwa tokeni zinazozalishwa na si kwa kikomo hicho. Faida ya kuwa na kikomo kikubwa ni kuondoa kizuizi kwenye jibu linaloweza kwenda vibaya. Toa usambazaji wa output_tokens kutoka kwenye logi zako, weka kikomo kidogo juu ya asilimia 95, na udhibiti stop_reason: "max_tokens" kwenye msimbo kwa kuendeleza jibu au kujaribu tena. Kukatwa kwa jibu unakokugundua kunagharimu kidogo kuliko maelezo marefu ya tokeni 4,000 unayolipa na kisha kuyaacha. Kufikiri kwa kina pia huishia kwenye output_tokens, kwa hivyo weka bajeti hiyo kulingana na ushahidi uleule.

Routing hufanya kazi pale sehemu ya gharama kubwa ya hatua inapokuwa ni ujazo badala ya uamuzi. Iache modeli yenye nguvu ifanye uamuzi, na ukabidhi uandishi kwa kitu cha bei nafuu. Pima toleo lililoelekezwa kwenye seti yako ya tathmini kwanza, kwa sababu modeli ya bei nafuu inayohitaji majaribio mawili inagharimu zaidi ya jaribio moja la bei ghali.

Batching ndiyo kigezo pekee kinachopunguza gharama za matokeo. Punguzo la 50% kwa pande zote mbili, matokeo ndani ya saa 24, na kazi yoyote iliyopangwa kwenye ratiba inastahiki.

Kigezo cha mwisho ndicho watu hukipuuza. Vifungu kama "kuwa makini" na "elezea hoja zako" huweka urefu wa matokeo yako kwenye kila ombi utakalofanya. Badilisha vifungu hivyo na umbo unalotaka: "Jibu kwa sentensi zisizozidi tatu", au "Rudisha kitu cha JSON pekee, bila utangulizi". Prompt ya mfumo inayoongeza tokeni 300 kwenye kila jibu inagharimu mara tano zaidi ya tokeni 300 zilezile zilizopo kwenye prompt yenyewe. kudhibiti gharama za wakala anayefanya kazi inashughulikia upande wa ufuatiliaji, na kama API au usajili wa bei moja ni nafuu kwa mfumo wako inafaa kuamuliwa kabla ya kutumia wiki nzima kurekebisha matumizi ya kila tokeni ambayo usajili ungeyagharamia. Kwa msanidi programu mmoja, hii inategemea kama Claude Pro ya $20 kwa mwezi na vikomo vya matumizi vinavyoambatana nayo inatosheleza kazi ambayo ungekuwa unaipima kwa tokeni. Ikiwa tayari unafikia vikomo hivyo katikati ya kipindi, kujua ni dirisha gani unalolisubiri ndilo la kwanza, kwa sababu suluhisho kutoka hapo ni modeli ndogo, muktadha mwepesi, mikopo ya ziada ya matumizi, au kuhamishia kazi hiyo kwenye API inayopimwa. Ikiwa API inayopimwa itageuka kuwa mahali nafuu zaidi kwa kazi hiyo, kushuka hadi mpango mdogo au kuusitisha kutakuacha na mwezi ambao tayari umeshalipia, kwa hivyo kufanya mabadiliko hayo hakukugharimu chochote unapotoka. Ikiwa mpango unaolinganisha na Pro ni wa ChatGPT badala ya API inayopimwa, ngazi mbili za usajili zilizopangwa kando kando zinaonyesha ni ipi inayotokea kuwa nafuu kwa kazi ya uandishi wa msimbo. Ikiwa swali hilo linaulizwa kwa ajili ya timu badala ya msanidi mmoja, kumbuka kuwa Claude Enterprise inaoanisha ada ya kila mtumiaji na tokeni zinazopimwa kwa viwango hivi vya API, kwa hivyo kila kigezo kwenye ukurasa huu bado kinatumika kwa nusu ya bili hiyo inayopimwa.

FAQ

Kwa nini token za pato (output) ni ghali zaidi kuliko token za ingizo (input)?

Kuzalisha token hizi hutumia muda mwingi zaidi wa kichakataji (accelerator) kwa kila token. Prompt huchakatwa kwa hatua moja ya mbele (forward pass) kwa maudhui yote, hivyo usomaji mmoja wa uzito wa modeli (model weights) unashughulikia maelfu ya token na maunzi hupata kikomo kutokana na kasi ya kuzidisha (multiply throughput). Jibu huzalishwa token moja kwa wakati mmoja, ambapo kila token inahitaji hatua yake ya mbele inayosoma uzito wote wa modeli tena, hivyo maunzi hupata kikomo kutokana na kipimo data cha kumbukumbu (memory bandwidth). Anthropic hutoza pato kwa bei mara tano ya ingizo katika katalogi nzima ya sasa, kuanzia Haiku 4.5 hadi Fable 5.

Je, prompt caching hufanya token za pato kuwa nafuu?

Hapana. Prompt caching inahusu ingizo pekee. Kufikia Agosti 2026, usomaji wa cache hugharimu 0.1x ya kiwango cha msingi cha ingizo, na uandishi wa cache hugharimu 1.25x kwa muda wa dakika 5 au 2x kwa muda wa saa 1. Pato hutozwa kwa kiwango kamili katika kila ombi, bila kujali cache ilifanya nini. Hii ndiyo sababu caching hubadilisha muundo wa bili yako pamoja na ukubwa wake: upande wa ingizo unapopungua, pato huwa ndilo sehemu kuu ya gharama inayopaswa kudhibitiwa.

Je, max_tokens ya juu hunigharimu pesa ikiwa jibu litakuja fupi?

Hapana. Unatozwa kwa token ambazo modeli huzalisha kikweli, kwa hivyo max_tokens ni ukomo wa juu na si hifadhi ya token. Bado ni muhimu, kwa sababu ndiyo kikomo pekee kigumu kwa jibu linaloendelea kuzalishwa bila mpangilio. Iweke kidogo juu ya asilimia 95 ya output_tokens unayozingatia, kisha dhibiti stop_reason: "max_tokens" kwenye msimbo (code) badala ya kutoa jibu lililokatwa kimyakimya.

Ninawezaje kupata uwiano wangu wa token za ingizo kwa pato?

Rekodi input_tokens, output_tokens, cache_read_input_tokens na cache_creation_input_tokens kutoka kwa kitu cha usage cha kila jibu, kisha ugawanye jumla yake kwa wiki nzima. Ikiwa uwiano ni zaidi ya 5 za ingizo kwa 1 ya pato, pesa yako iko kwenye prompt, kwa hivyo hifadhi sehemu isiyobadilika kwenye cache na upunguze iliyobaki. Ikiwa uwiano ni chini ya hapo, pesa yako iko kwenye jibu, kwa hivyo punguza urefu wake na uhamishe hatua zinazozalisha sehemu kubwa ya jibu hilo kwenda kwenye modeli nafuu au kwenye Batch API.