Ni modeli gani ya Claude nitumie? Miongozo
Linganisha gharama za Claude Opus 4.8, Sonnet 5 na Haiku 4.5. Pata bei za MTok za Julai 2026 na mchanganuo wa gharama kwa kazi 100,000 za API.
Ni modeli gani ya Claude ninayopaswa kuitumia?
Jibu fupi kuhusu modeli ya Claude unayopaswa kuitumia: anza na Claude Opus 4.8, na uache kuitumia tu ikiwa una sababu maalum. Mwongozo wa Anthropic ni ule ule. "Ikiwa huna uhakika kuhusu modeli ya kutumia, anza na Claude Opus 4.8 kwa uandishi wa kodi wa agentic na kazi za kibiashara." Tumia Claude Sonnet 5 wakati kazi imeelezwa vizuri na unaitumia mara nyingi kwa siku. Tumia Claude Haiku 4.5 kwa kazi za kiufundi zenye idadi kubwa ambapo tayari unajua jibu sahihi linavyoonekana. Claude Fable 5 iko juu ya zote kwa ajili ya agent zinazojiendesha kwa muda mrefu.
Uchaguzi huu una gharama yake. Hizi ni bei za Claude API (application programming interface) kuanzia tarehe 23 July 2026, kwa kila milioni ya tokens, ambazo nyaraka zinaandika kama MTok.
- Claude Fable 5 (
claude-fable-5): $10 / MTok in, $50 / MTok out. 1M context. - Claude Opus 4.8 (
claude-opus-4-8): $5 in, $25 out. 1M context. - Claude Opus 4.7 (
claude-opus-4-7): $5 in, $25 out. 1M context. - Claude Sonnet 5 (
claude-sonnet-5): $2 in, $10 out kwa bei ya utangulizi hadi 31 August 2026. Bei ya kawaida ya $3 in, $15 out itaanza kutumika tarehe 1 September 2026. 1M context. - Claude Haiku 4.5 (
claude-haiku-4-5): $1 in, $5 out. 200K context.
Vihusishi hivyo viko kamili kama vilivyoandikwa. Hakuna kitu kingine kinaongezwa kwenye hivyo.
Ukubwa wenyewe hauna nyongeza ya gharama kwenye modeli za 1M-token: "Ombi la 900k-token linaandikishwa kwa kiwango kilekile cha kila-token kama ombi la 9k-token."
Matumizi halisi ya kila modeli
Anthropic inaelezea kila modeli kwa mstari mmoja, na maelezo hayo ni bora zaidi kuliko chati yoyote ya ulinganifu.
- Claude Fable 5: "Akili ya kizazi kipya kwa ajenti wanaofanya kazi kwa muda mrefu." Imeorodheshwa kuwa na ucheleweshaji (latency) wa juu zaidi kati ya nne.
- Claude Opus 4.8: "Kwa uandishi wa kodi wa ajenti tata na kazi za kibiashara." Ucheleweshaji wa wastani.
- Claude Sonnet 5: "Mchanganyiko bora wa kasi na akili." Ina kasi.
- Claude Haiku 4.5: "Model yenye kasi zaidi yenye akili inayokaribia kiwango cha juu."
Haiku 4.5 pia ina vikomo vinavyoamua utendaji wake kabla ya bei. Dirisha lake la muktadha (context window) ni tokeni 200K badala ya 1M, hivyo orodha kubwa ya faili au maelezo marefu ya ajenti hayataingia. Output yake ya juu kwenye synchronous Messages API ni tokeni 64K ikilinganishwa na 128K kwa nyingine, na kikomo chake cha maarifa ni Februari 2025, wakati nyingine tatu ziko Januari 2026.
Chaguo hili litaniathirije gharama kwenye mzigo halisi wa kazi?
Kila modeli katika mfululizo huu huweka bei ya matokeo (output) mara tano ya kiwango cha pembejeo (input). Opus 4.8 ni $5 kwa pembejeo na $25 kwa matokeo. Haiku 4.5 ni $1 kwa pembejeo na $5 kwa matokeo. Uwiano huu unabaki katika mfululizo mzima, hivyo modeli unayochagua ina umuhimu mkubwa kwenye kazi zinazozalisha matokeo mengi.
Kazi za agentic ni aina hiyo ya kazi, kwa sababu tokeni za kufikiri (thinking tokens) hutozwa kama tokeni za matokeo na huhesabiwa kwenye max_tokens hata kama maandishi hayafiki kwako. Kwenye Fable 5, Opus 4.8, Opus 4.7 na Sonnet 5, muhtasari wa kufikiri huondolewa kwa kiamuzi (default), hivyo uwanja wa thinking hurudi ukiwa tupu. Malipo hayabadiliki: "Vyovyote vile, kitalu (block) hutozwa sawa na kurudishwa sawa katika mazungumzo ya mzunguko zaidi ya moja." Nini hasa hujaza bili ya tokeni ya Claude huchambua mchakato huo kwa kina.
Kama kufikiri (thinking) kutaingia au la hutofautiana kati ya modeli unazozilinganisha, jambo ambalo litaharibu majaribio ya gharama ikiwa utalipuuza. Kwenye Sonnet 5 na Fable 5, kufikiri tayari kiko wazi na hakuhitaji usanidi. Kwenye Opus 4.8 na Opus 4.7, kiko wazi (off) hadi uweke thinking: {type: "adaptive"} kwenye ombi (request). Linganisha usanidi upande zote mbili kabla ya kuchambua namba hizo.
Kwa nini modeli ya bei nafuu inaweza kuwa ghali zaidi
Chukua kazi moja ya uandishi wa kodi. Ombi lina context ya tokens 60,000, na modeli inatoa output ya tokens 8,000 ikiwa ni pamoja na kufikiri. Bila caching, hesabu inabaki wazi.
Kwenye Opus 4.8: 0.06 MTok ya input kwa $5 ni $0.30, na 0.008 MTok ya output kwa $25 ni $0.20. Jaribio hilo linagharimu $0.50. Kwenye Haiku 4.5 jaribio lile lile ni $0.06 plus $0.04, yaani $0.10.
Haiku ni mara tano nafuu zaidi kwa kila jaribio, jambo ambalo linaonekana kuwa na faida kubwa mpaka utakapofuatilia matokeo ya jaribio lililofeli. Unasoma jibu lisilo sahihi, ambalo linapoteza muda wako. Unalirudisha kama context kwenye jaribio la pili, hivyo kila jaribio linakuwa kubwa kuliko lililopita. Na jaribio la tatu linaposhindwa bado, unalazimika kutumia modeli kubwa: $0.30 ya Haiku plus $0.50 ya Opus ni $0.80, au zaidi kwa 60% kuliko kutumia Opus mara moja.
Hivyo swali la msingi ni jinsi unavyoweza kukagua jibu kwa gharama nafuu. Jibu lisilo sahihi linapokuwa wazi ndani ya sekunde moja, modeli ndogo ni ya bei nafuu sana. Jibu linapohitaji kusoma diff kwa uangalifu, modeli ndogo inakugharimu muda ambao hautaonekana kwenye bili.
Pale ambapo modeli ndogo hushinda kabisa
Haiku 4.5 ndiyo chaguo sahihi katika hali hizi:
- Kazi za kiufundi za subagent. Subagent inayobadilisha majina ya faili au kukusanya matokeo ya utafutaji haihitaji uwezo mkubwa wa kufikiri. Huu ni mfumo wa kawaida baada ya build an AI agent with Claude na kuipa msaidizi.
- Uchambuzi wa logi. Kuamua kama mstari ni kelele au unastahili uangalizi wa binadamu ni uamuzi finyu wenye mbinu za kushindwa zilizo wazi.
- Uainishaji dhidi ya seti ya lebo iliyofungwa. Matokeo ni mafupi na usahihi unaweza kupimwa kwenye sampuli.
- Simu nyingi za uzalishaji. Kwa makisio ya 100,000 kila siku, tofauti ya gharama ya kila token inakuwa kubwa. Huu ndio muundo wa kawaida wa AI workflows wired into n8n.
- Kila kitu ambapo kasi ya jibu ni muhimu kwa mtumiaji. Haiku 4.5 imepata alama ya kuwa modeli yenye kasi zaidi katika mfululizo huu.
Kikomo kimoja ni cha Haiku pekee. Prompt yake ya chini inayoweza kuhifadhiwa kwenye cache ni token 4,096, tofauti na token 1,024 kwenye Opus 4.8 na Sonnet 5. Chini ya kiwango hicho, "maombi yoyote ya kuhifadhi chini ya idadi hii ya token yatashughulikiwa bila kuhifadhiwa kwenye cache, na hakuna kosa litakalotolewa". Block ya maelekezo ya token 1,500 inayohifadhiwa kwenye cache kwenye Sonnet 5 haitahifadhiwa kwenye cache kwenye Haiku 4.5. Dalili ni cache_creation_input_tokens na cache_read_input_tokens zote zikiwa kwenye sifuri, jambo ambalo keeping an always-on agent's costs down linashughulikia pamoja na njia nyingine za kupoteza cache.
Viashiria vinavyobadilisha jibu
Kila kimoja kati ya haya huleta mabadiliko kubwa zaidi kuliko jina la modeli lenyewe.
Effort. output_config.effort hudhibiti kiasi cha kazi kinachofanywa na modeli kabla ya kujibu. Viwango ni low, medium, high, xhigh na max, na high ndio chaguo la kawaida: "Kuweka effort kuwa high kunazalisha tabia inayofanana kabisa na kuacha kiparameta cha effort kabisa." Kipo ndani ya output_config badala ya kuwa katika kiwango cha juu cha ombi:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)Effort huathiri kila token kwenye jibu: "Inaweza kuathiri matumizi ya token zote ikiwemo mwito wa zana (tool calls). Kwa mfano, effort ndogo itamaanisha Claude anafanya mwito mchache wa zana." Hii huongezeka katika mzunguko wa agentic. Sio kikomo cha token: "Effort ni ishara ya tabia, si bajeti kali ya token." Anthropic haitoi nyongeza ya gharama kwa kila kiwango na inakushauri ujifanyie majaribio ya matumizi yako, hivyo Sonnet 5 inayofanya kazi kwa high dhidi ya Opus 4.8 inayofanya kazi kwa low ni ulinganifu halisi unaoweza kuufanya leo hii. Haiku 4.5 haipo kwenye orodha ya modeli zinazounga mkono effort.
Prompt caching. Kusoma cache kuna gharama ya 0.1x ya kiwango cha msingi cha input, na namba inayochagua chaguo la modeli ni kile kinachofanyika katika viwango vyote. Cache hit kwenye Opus 4.8 ina gharama ya $0.50 / MTok, na input isiyo na cache kwenye Haiku 4.5 ina gharama ya $1 / MTok, hivyo prefix ya Opus iliyohifadhiwa vizuri ni nafuu zaidi kwa kila input token kuliko prompt ya Haiku isiyo na cache. Usafi wa session ni muhimu zaidi kuliko uchaguzi wa modeli kwenye kazi yoyote inayotuma tena prefix kubwa iliyo thabiti.
Batches. Ikiwa hakuna kinachosubiri jibu, Message Batches API huendesha modeli zilezile kwa "punguzo la 50% kwenye token za input na output". Inapunguza kila mstari wa ulinganifu hapa chini kwa nusu, na inafanya kazi katika viwango vyote: kazi ya Opus 4.8 ya batched ina gharama ndogo kuliko kazi ya Sonnet 5 ya synchronous kwa bei ya kawaida kuanzia 1 September 2026, ikibadilisha latency kwa uwezo kwa pesa sawa.
Ulinganisho wa gharama kwa kazi moja
Mzigo wa kazi: tanguliza aina ya barua pepe 100,000 za msaada, simu moja kwa kila barua pepe, tokeni 2,000 za kuingiza (input tokens) na tokeni 300 za kutokeza (output tokens) kwa kila simu. Hii ni 200 MTok za kuingiza na 30 MTok za kutokeza.
- Haiku 4.5: 200 x $1 = $200 za kuingiza, 30 x $5 = $150 za kutokeza. Jumla $350.
- Sonnet 5, bei ya kuanzia: 200 x $2 = $400 za kuingiza, 30 x $10 = $300 za kutokeza. Jumla $700.
- Sonnet 5, kuanzia 1 September 2026: 200 x $3 = $600 za kuingiza, 30 x $15 = $450 za kutokeza. Jumla $1,050.
- Opus 4.8: 200 x $5 = $1,000 za kuingiza, 30 x $25 = $750 za kutokeza. Jumla $1,750.
Badilisha namba nne ili kufanya upya hesabu hii kwa bei za kesho. Marekebisho hapa chini yanabadilisha matokeo zaidi kuliko jina la modeli:
- Batching inapunguza kila mstari kwa nusu: $175, $350, $525 na $875. Hakuna kitu kinachosubiri wakati wa mchakato wa usiku wa kila siku, hivyo hakuna sababu ya kuacha.
- Kuhifadhi prefix inayoshirikishwa (Caching the shared prefix). Kwa mfano, 1,200 kati ya tokeni 2,000 za kuingiza ni kitalu cha maelekezo kinachofanana kila wakati. Kwenye Sonnet 5 kwa bei ya kuanzia, gharama hizo ni $0.20 / MTok kama cache hits badala ya $2 / MTok, hivyo 120 MTok ina gharama ya $24 badala ya $240. Ongeza 80 MTok za kuingiza mpya kwa $2, ambayo ni $160, pamoja na $300 za kutokeza, na Sonnet 5 inafikia karibu $484 badala ya $700. Mbinu hiyo hiyo haifanyi kazi kwenye Haiku 4.5, kwa sababu 1,200 ni chini ya kiwango chake cha chini cha tokeni 4,096.
- Jaribio upya (Retries). Tuseme unakataa jibu la Haiku kwenye 8% ya barua pepe na unalirudia kwenye Opus 4.8. Ongeza 0.08 x $1,750 = $140 kwenye $350, ikitoa $490. Pima kiwango chako cha kukataa badala ya kutumia changu.
- Ufafanuzi wa zana (Tool definitions), ikiwa kazi inazitumia. Prompt ya mfumo inayozalishwa ni tokeni 290 kwenye Opus 4.8 ikiwa
tool_choiceimewekwa kuwaauto, 354 kwenye Sonnet 5 na 496 kwenye Haiku 4.5. Model ya bei nafuu zaidi ina gharama kubwa zaidi ya awali (fixed overhead).
Haiku yenye njia ya upandaji (escalation path) kwa $490 na Sonnet 5 iliyohifadhiwa (cached) kwa $484 zina gharama sawa, na moja kati ya hizo hufanya kazi katika hatua moja. Model haikuwa swali lote.
Je, kubadilisha mifano katikati ya kikao kunaokoa pesa?
Hali hii hutokea mara chache kuliko bei zinavyoonyesha, kwa sababu uokoaji hupimwa kwa token na kitu unachoweza kukipoteza ni prefix nzima iliyohifadhiwa (cached prefix).
Anthropic inaelezea mambo yanayofanya cache kutofanya kazi. Prefix hujengwa kwa mpangilio wa tools, kisha system, kisha messages, na "Mabadiliko katika kila ngazi yanafuta ngazi hiyo na ngazi zote zinazofuata." Mpangilio wa mipangilio miwili ya maombi pia upo kwenye orodha hiyo: "Mipangilio ya kufikiri (thinking configuration) na ngazi ya effort iliyopatikana huwekwa ndani ya prompt yenyewe, hivyo kubadilisha chochote kati yake huanzisha prefix mpya ya cache." Katika sehemu ya juhudi (effort), nyaraka zinaeleza zaidi: "badilisha juhudi kati ya kazi tofauti badala ya ndani ya mazungumzo yanayotegemea cache hits".
Model haipo kwenye orodha hiyo iliyoandikwa, hivyo usichukulie kama jambo la uhakika. Soma cache_read_input_tokens kwenye ombi la kwanza baada ya kubadilisha na utumie namba hiyo kujibu. Kwa prefix ya Opus ya token 150,000 ya 4.8, kusoma cache hutumia takriban $0.08 na kuandika upya hutumia takriban $0.94, ambayo ni zaidi ya tofauti ya token kadhaa uliyokuwa unaifuatilia.
Hivyo, badilisha mambo haya kati ya kazi, si ndani ya kazi moja. Katika Claude Code, hiyo inamaanisha /clear kwanza, wakati cache inatupwa anyway, kisha /model au /effort.
Jinsi ya kujaribu jibu kwenye mzigo wako wa kazi
Usipange ukubwa wa prompt kwa kutumia idadi kutoka kwa model nyingine. Endpoint ya kuhesabu token ni bure na huhesabu kwa kutumia tokenizer ya model unayochagua, hivyo chagua model unayopanga kuitumia. Opus 4.7 na baadaye, Fable 5 na Sonnet 5 hutumia tokenizer mpya ambayo "hutengeneza takriban token 30% zaidi kwa maandishi yaleyo yale", hivyo bajeti iliyopimwa kwenye model ya zamani itakuwa ndogo kwenye model mpya hata kama bei ya token haibadiliki.
Kisha soma matokeo yaliyorudishwa. input_tokens ni sehemu iliyobaki ambayo haijahifadhiwa (uncached), hivyo ukubwa halisi wa prompt ni field hiyo pamoja na cache_creation_input_tokens na cache_read_input_tokens. App ya kwanza ya Claude API kwenye VPS ndio mahali bora zaidi na salama pa kufanya vipimo hivyo, na mpango wa Claude unaofaa matumizi yako ni uamuzi tofauti kuhusu kama utalipa kwa kila token au la.
FAQ
Ni Claude model gani bora kwa coding?
Claude Opus 4.8 ndio kuanzia iliyodokumentiwa kwa ajili ya agentic coding tata, kwa $5 kwa milioni ya input tokens na $25 kwa milioni ya output kuanzia Julai 2026. Claude Sonnet 5 imewekwa kama mchanganyiko bora wa kasi na akili, na kwa $2 / $10 hadi 31 August 2026 gharama yake ni chini ya nusu ya nyingine. Run kazi ile ile kwenye zote mbili, weka thinking configuration ikiwa imetulia, na ulinganishe matumizi ya jumla ya token kutoka response.usage.
Je, Claude Haiku 4.5 ni rahisi kutosha kuchukua nafasi ya Sonnet 5?
Kwa token, kwa urahisi: $1 / $5 dhidi ya $2 / $10 kwa Sonnet 5 kwenye bei ya kuanzia, au $3 / $15 kuanzia 1 September 2026. Mipaka ndiyo inayofanya uamuzi. Haiku 4.5 ina context window ya 200K token badala ya 1M, output ya juu ya 64K kwenye synchronous Messages API, cutoff ya maarifa ya Februari 2025, haina support ya output_config.effort, na prompt ya chini ya 4,096-token inayoweza kuwekwa kwenye cache ambayo inazima caching kwenye system prompts fupi.
Je, kubadilisha kwenda Claude model rahisi zaidi katikati ya session kunaokoa pesa?
Hufanyika mara chache kuliko inavyoonekana. Anthropic inaorodhesha cache invalidators kama mabadiliko kwenye prefix ya tools, system au messages, mabadiliko kwenye thinking configuration, na mabadiliko kwenye output_config.effort. Jinsi model switch inavyoathiri cache iliyopo haijawekwa kwenye nyaraka, hivyo itazamwe kama isiyojulikana na usome cache_read_input_tokens kwenye ombi la kwanza baada ya hapo. Hii ni muhimu kujua: kwenye Opus 4.8 prefix ya 150,000-token, cache read inagharimu takriban $0.08 na fresh write inagharimu takriban $0.94, jambo ambalo ni kubwa kuliko uokoaji wa token wa mzunguko kadhaa. Badilisha kati ya kazi baada ya /clear kwenye Claude Code, wakati cache inatupwa bila kujali.
output_config.effort inafanya nini kwenye bili yangu?
Inabadilisha jinsi model inavyotumia token kwenye maandishi, tool calls, na thinking. Effort ya chini hufanya tool calls chache, jambo ambalo huongeza gharama kwenye agentic loops kwa sababu kila matokeo ya tool yanatumwa tena kwenye mzunguko unaofuata. Ngazi ni low, medium, high, xhigh na max, huku high ikiwa ni default. Anthropic haitoi multiplier ya gharama kwa kila ngazi, ikitaja effort kama ishara ya tabia badala ya bajeti ya token, hivyo ipime kwenye kazi yako mwenyewe.
Claude Batches API inaokoa kiasi gani?
50% kwenye input na output tokens, kwa ajili ya utoaji wa asynchronous. Kuanzia Julai 2026 hiyo inafanya Opus 4.8 kuwa $2.50 in / $12.50 out, Sonnet 5 kuwa $1 / $5 kwenye bei ya kuanzia, na Haiku 4.5 kuwa $0.50 / $2.50. Ulinganishaji wa muhimu unaonyesha tofauti kati ya tiers: kazi ya batched Opus 4.8 inagharimu chini ya kazi ya synchronous Sonnet 5 kwa bei ya kawaida kuanzia 1 September 2026, hivyo batching inakupa model yenye nguvu zaidi kwa pesa ile ile.