Anong Claude model ang sulit gamitin?
Alamin ang presyo ng Claude Opus 4.8, Sonnet 5, at Haiku 4.5. May comparison kami sa cost ng 100,000 jobs para malaman ang tamang model para sa iyong budget.
Anong Claude model ang dapat kong gamitin?
Ang maikling sagot sa kung anong Claude model ang dapat mong gamitin: magsimula sa Claude Opus 4.8, at lumipat lamang kung mayroon kang partikular na dahilan. Ganito rin ang gabay ng Anthropic. "Kung hindi ka sigurado kung anong model ang gagamitin, simulan ang Claude Opus 4.8 para sa complex agentic coding at enterprise work." Bumaba sa Claude Sonnet 5 kapag ang task ay well specified at paulit-ulit mong ginagawa araw-araw. Bumaba muli sa Claude Haiku 4.5 para sa mechanical at high-volume na trabaho kung saan alam mo na ang hitsura ng tamang sagot. Ang Claude Fable 5 ang pinakamataas sa lahat para sa mga long-running agents.
May katumbas na presyo ang pagpili. Ito ang mga rate sa Claude API (application programming interface) simula noong 23 July 2026, bawat isang milyon na tokens (MTok).
- Claude Fable 5 (
claude-fable-5): $10 / MTok in, $50 / MTok out. 1M context. - Claude Opus 4.8 (
claude-opus-4-8): $5 in, $25 out. 1M context. - Claude Opus 4.7 (
claude-opus-4-7): $5 in, $25 out. 1M context. - Claude Sonnet 5 (
claude-sonnet-5): $2 in, $10 out sa introductory pricing hanggang 31 August 2026. Ang standard na $3 in, $15 out ay magsisimula sa 1 September 2026. 1M context. - Claude Haiku 4.5 (
claude-haiku-4-5): $1 in, $5 out. 200K context.
Ang mga identifier na iyan ay kumpleto na. Walang idinadagdag sa mga ito.
Walang surcharge ang laki ng request sa mga 1M-token models: "Ang 900k-token request ay sisingilin sa parehong per-token rate gaya ng 9k-token request."
Ang gamit ng bawat model
Inilalarawan ng Anthropic ang bawat model sa isang linya, at mas kapaki-pakinabang ang mga ito kaysa sa anumang leaderboard.
- Claude Fable 5: "Next-generation intelligence for long-running agents." Ito ang may pinakamabagal na latency sa apat.
- Claude Opus 4.8: "For complex agentic coding and enterprise work." Moderate ang latency nito.
- Claude Sonnet 5: "The best combination of speed and intelligence." Mabilis ito.
- Claude Haiku 4.5: "The fastest model with near-frontier intelligence."
May mga limitasyon din ang Haiku 4.5 na dapat isaalang-alang bago ang presyo. Ang context window nito ay 200K tokens sa halip na 1M, kaya hindi kakasya ang malalaking repository o mahahabang agent transcript. Ang maximum output nito sa synchronous Messages API ay 64K tokens kumpara sa 128K ng iba, at ang knowledge cutoff nito ay February 2025, habang ang tatlong iba ay nasa January 2026.
Ano ang magiging gastos sa isang real workload?
Ang bawat model sa lineup ay nagpepresyo ng output nang limang beses ang rate kaysa sa input. Ang Opus 4.8 ay $5 sa input at $25 sa output. Ang Haiku 4.5 ay $1 sa input at $5 sa output. Ang ratio na ito ay pareho sa buong range, kaya mahalaga ang piniling model sa mga trabahong maraming output.
Ang agentic work ay ganitong uri ng trabaho, dahil ang thinking tokens ay binibilang bilang output tokens at kasama sa max_tokens kahit hindi makarating ang text sa iyo. Sa Fable 5, Opus 4.8, Opus 4.7 at Sonnet 5, ang reasoning summary ay hindi kasama by default, kaya ang thinking field ay empty. Walang pagbabago sa billing: "Either way the block is billed the same and passed back the same in multi-turn conversations." Ano ang nagpapataas sa Claude token bill ang nagpapaliwanag nito nang buo.
Nagkakaiba ang pagtakbo ng thinking sa mga model na pinaghahambing mo, na maaaring makasira sa cost test kung hindi mo ito mapapansin. Sa Sonnet 5 at Fable 5, naka-on na ang thinking at hindi na kailangan ng configuration. Sa Opus 4.8 at Opus 4.7, naka-off ito hangga't hindi mo i-set ang thinking: {type: "adaptive"} sa request. Siguraduhing pareho ang configuration sa magkabilang panig bago suriin ang mga numero.
Bakit maaaring maging pinakamahal ang pinakamurang model
Kumuha ng isang self-contained coding task. Ang request ay may 60,000 tokens na context, at ang model ay maglalabas ng 8,000 tokens na output kasama ang thinking. Walang caching, kaya ang arithmetic ay malinaw na makikita.
Sa Opus 4.8: Ang 0.06 MTok na input sa $5 ay $0.30, at ang 0.008 MTok na output sa $25 ay $0.20. Ang halaga ng isang attempt ay $0.50. Sa Haiku 4.5, ang parehong attempt ay $0.06 plus $0.04, kaya $0.10.
Ang Haiku ay limang beses na mas mura bawat attempt, na tila malaking tipid hanggang sa makita ang epekto ng isang failed attempt. Mababasa mo ang maling sagot, na kumakain ng iyong oras. Ise-send mo itong muli bilang context sa retry, kaya ang bawat attempt ay mas malaki kaysa sa nauna. At kapag hindi pa rin tama ang ikatlong attempt, gagamit ka na rin ng mas malakas na model: ang $0.30 ng Haiku plus $0.50 ng Opus ay $0.80, o 60% na mas mahal kaysa sa isang beses na paggamit ng Opus.
Kaya ang mahalagang tanong ay kung gaano kamura ang pag-verify sa sagot. Kapag ang maling sagot ay halata agad sa loob ng isang segundo, sulit ang maliit na model. Kapag ang pagtukoy sa mali ay nangangailangan ng masusing pagbabasa ng diff, ang maliit na model ay kumakain ng oras na hindi nakikita sa invoice.
Kung kailan mas lamang ang mas maliit na model
Haiku 4.5 ang tamang piliin sa mga kasong ito:
- Mechanical subagent work. Hindi kailangan ng frontier reasoning para sa subagent na nagre-rename ng files o kumukuha ng search output. Ito ang standard pattern kapag nag-build ka ng AI agent gamit ang Claude at binigyan ito ng mga helper.
- Log triage. Ang pagpapasya kung ang isang linya ay noise lang o dapat suriin ng tao ay isang narrow judgement na may malinaw na failure mode.
- Classification laban sa isang fixed label set. Maikli ang output at nasusukat ang accuracy gamit ang isang sample.
- High-volume production calls. Sa 100,000 runs kada araw, ang per-token gap ay hindi na maituturing na rounding error. Ito ang karaniwang setup ng AI workflows na naka-wire sa n8n.
- Anumang bagay kung saan mahalaga ang bilis ng response para sa user. Ang Haiku 4.5 ang pinakamabilis na model sa lineup.
May isang limitasyon ang Haiku. Ang minimum cacheable prompt nito ay 4,096 tokens, kumpara sa 1,024 sa Opus 4.8 at Sonnet 5. Kapag mas mababa sa minimum na ito, "any requests to cache fewer than this number of tokens will be processed without caching, and no error is returned". Ang isang 1,500-token instruction block na nag-ca-cache sa Sonnet 5 ay hindi mag-ca-cache sa Haiku 4.5. Malalaman ito kung ang cache_creation_input_tokens at cache_read_input_tokens ay parehong zero, na kasama sa mga dahilan para hindi ma-cache ang isang agent, gaya ng pagpapanatili ng mababang cost ng isang always-on agent.
Ang mga lever na nagpapabago sa resulta
Ang bawat isa sa mga ito ay mas malaki ang epekto kaysa sa mismong pangalan ng model.
Effort. Kinokontrol ng output_config.effort kung gaano karaming trabaho ang gagawin ng model bago ito sumagot. Ang mga level ay low, medium, high, xhigh at max, at high ang default: "Ang pag-set ng effort sa high ay magbibigay ng eksaktong parehong behavior gaya ng pag-omit sa effort parameter." Naka-nest ito sa loob ng output_config sa halip na nasa top level ng request:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)Ang effort ay nakakaapekto sa bawat token sa response: "Maaari nitong maapektuhan ang lahat ng token spend kabilang ang mga tool call. Halimbawa, ang mas mababang effort ay nangangahulugang mas kaunting tool calls ang gagawin ni Claude." Nagpapatong ito sa isang agentic loop. Hindi ito token cap: "Ang effort ay isang behavioral signal, hindi isang strict token budget." Walang inilalathalang cost multiplier ang Anthropic bawat level at pinapagawa ka sa sarili mong use case, kaya ang pagtakbo ng Sonnet 5 sa high laban sa Opus 4.8 sa low ay isang valid na comparison na magagawa mo na ngayong hapon. Ang Haiku 4.5 ay wala sa listahan ng mga model na sumusuporta sa effort.
Prompt caching. Ang cache read ay may gastos na 0.1x ng base input rate, at ang numerong ito ang nagtatakda ng model choice depende sa tier. Ang cache hit sa Opus 4.8 ay nagkakahalaga ng $0.50 / MTok, habang ang uncached input sa Haiku 4.5 ay $1 / MTok, kaya ang isang well-cached na Opus prefix ay mas mura bawat input token kaysa sa isang cold Haiku prompt. Mas matipid ang session hygiene kaysa sa model choice sa anumang workload na paulit-ulit na nagpapadala ng malaking stable prefix.
Batches. Kung hindi kailangan ang agarang sagot, ang Message Batches API ay nagpapatakbo ng parehong mga model na may "50% discount sa parehong input at output tokens". Hinahati nito ang bawat row sa comparison sa ibaba, at gumagana ito sa lahat ng tiers: ang isang batched na Opus 4.8 job ay mas mura kaysa sa isang synchronous na Sonnet 5 job sa standard price simula 1 September 2026, kung saan ipinapalit ang latency para sa capability sa parehong halaga.
Paghahambing ng gastos sa isang workload
Ang workload: i-classify ang 100,000 support emails, isang tawag bawat isa, 2,000 input tokens at 300 output tokens bawat tawag. Ito ay 200 MTok na input at 30 MTok na output.
- Haiku 4.5: 200 x $1 = $200 in, 30 x $5 = $150 out. Total $350.
- Sonnet 5, introductory rate: 200 x $2 = $400 in, 30 x $10 = $300 out. Total $700.
- Sonnet 5, simula 1 September 2026: 200 x $3 = $600 in, 30 x $15 = $450 out. Total $1,050.
- Opus 4.8: 200 x $5 = $1,000 in, 30 x $25 = $750 out. Total $1,750.
Palitan ang apat na numero para muling kalkulahin gamit ang presyo bukas. Ang mga adjustment sa ibaba ay nagpapabago sa resulta nang mas malaki kaysa sa pangalan ng model:
- Batching halves every line: $175, $350, $525 at $875. Walang naghihintay sa isang nightly classification run, kaya walang dahilan para hindi ito gamitin.
- Caching ng shared prefix. Halimbawa, 1,200 sa 2,000 input tokens ang parehong instruction block sa bawat pagkakataon. Sa Sonnet 5 sa introductory rate, ang gastos ay $0.20 / MTok bilang cache hits sa halip na $2 / MTok, kaya ang 120 MTok ay nagkakahalaga ng $24 sa halip na $240. Magdagdag ng 80 MTok na bagong input sa $2, na nagkakahalaga ng $160, plus $300 na output, at ang Sonnet 5 ay magiging malapit sa $484 sa halip na $700. Ang parehong teknik ay walang epekto sa Haiku 4.5, dahil ang 1,200 tokens ay mas mababa sa 4,096-token minimum nito.
- Retries. Ipagpalagay na i-reject mo ang sagot ng Haiku sa 8% ng mga email at i-run muli ang mga ito sa Opus 4.8. Idagdag ang 0.08 x $1,750 = $140 sa $350, na magbibigay ng $490. Sukatin ang sarili mong rejection rate sa halip na gamitin ang sa akin.
- Tool definitions, kung ginagamit ito sa trabaho. Ang system prompt na ginagawa nila ay 290 tokens sa Opus 4.8 kapag ang
tool_choiceay naka-set saauto, 354 sa Sonnet 5 at 496 sa Haiku 4.5. Ang pinakamurang model ang may pinakamalaking fixed overhead.
Ang Haiku na may escalation path sa $490 at ang cached Sonnet 5 sa $484 ay pareho ang gastos, at ang isa sa kanila ay natatapos ang trabaho sa isang pass lang. Ang model ay hindi ang buong usapin.
Makakatipid ba sa gastos kung magpapalit ng model sa gitna ng session?
Hindi ito laging totoo gaya ng nakasaad sa sticker prices, dahil ang matitipid ay per token lamang at ang mawawala sa iyo ay ang buong cached prefix.
Dokumentado ng Anthropic kung ano ang nagpapawalang-bisa sa isang cache. Ang mga prefix ay binubuo sa pagkakasunod-sunod na tools, pagkatapos ay system, at pagkatapos ay messages, at "Ang anumang pagbabago sa bawat level ay nagpapawalang-bisa sa level na iyon at sa lahat ng susunod na levels." Kasama rin sa listahan ang dalawang request settings: "Ang thinking configuration at ang resolved effort level ay isinasama sa mismong prompt, kaya ang pagbabago sa alinman sa mga ito ay magsisimula ng bagong cache prefix." Ayon sa docs, mas mabuting "iba-iba ang effort sa iba't ibang workloads sa halip na sa loob ng isang conversation na umaasa sa cache hits".
Hindi kasama ang model sa dokumentadong listahang iyon, kaya huwag itong asahan sa anumang paraan. Basahin ang cache_read_input_tokens sa unang request pagkatapos ng pagpapalit at tingnan ang resulta. Sa isang 150,000-token Opus 4.8 prefix, ang cache read ay nagkakahalaga ng humigit-kumulang $0.08 at ang fresh write ay humigit-kumulang $0.94, na mas mahal kaysa sa matitipid sa ilang turns ng per-token gap na iyong hinahabol.
Kaya baguhin ang mga bagay na ito sa pagitan ng mga task, hindi sa loob ng isang task. Sa Claude Code, ibig sabihin nito ay /clear muna, habang tinatapon naman ang cache, pagkatapos ay /model o /effort.
Paano i-test ang sagot sa sarili mong workload
Huwag magtakda ng prompt size gamit ang bilang mula sa ibang model. Libreng gamitin ang token-counting endpoint at gumagamit ito ng tokenizer ng model na tinukoy mo, kaya gamitin ang model na balak mong i-call. Ang Opus 4.7 at mas bago, pati ang Fable 5 at Sonnet 5, ay gumagamit ng mas bagong tokenizer na "naglalabas ng humigit-kumulang 30% na mas maraming tokens para sa parehong text". Dahil dito, ang budget na sinukat sa lumang model ay magiging kulang sa mas bagong model kahit hindi magbago ang per-token rate.
Pagkatapos, basahin ang resulta. Ang input_tokens ay ang uncached remainder lamang, kaya ang tunay na prompt size ay ang field na iyon plus cache_creation_input_tokens plus cache_read_input_tokens. Ang Unang Claude API app sa isang VPS ang pinakamadaling paraan para patakbuhin ang pagsusuring iyon, at ang kung aling Claude plan ang angkop sa iyong usage ay isang hiwalay na desisyon kung magbabayad ka ba bawat token o hindi.
FAQ
Aling Claude model ang pinakamahusay para sa coding?
Ang Claude Opus 4.8 ang documented na simula para sa complex agentic coding, sa halagang $5 bawat million input tokens at $25 bawat million output as of July 2026. Ang Claude Sonnet 5 ang pinakamahusay na kombinasyon ng bilis at intelligence; sa halagang $2 / $10 hanggang 31 August 2026, mas mura ito nang higit sa kalahati. Patakbuhin ang parehong task sa dalawang model, panatilihing constant ang thinking configuration, at i-compare ang total token spend mula sa response.usage.
Sapat na ba ang murang Claude Haiku 4.5 para palitan ang Sonnet 5?
Sa per-token basis, oo: $1 / $5 kumpara sa $2 / $10 para sa Sonnet 5 sa introductory pricing, o $3 / $15 simula 1 September 2026. Ang mga limits ang magpapasya nito. Ang Haiku 4.5 ay may 200K token context window sa halip na 1M, may 64K maximum output sa synchronous Messages API, may February 2025 reliable knowledge cutoff, walang output_config.effort support, at may 4,096-token minimum cacheable prompt na nag-o-off ng caching sa mga maikling system prompt.
Nakakatipid ba ang paglipat sa mas murang Claude model sa gitna ng session?
Hindi kasing dalas ng inaakala. Ang Anthropic ay nag-document ng mga cache invalidators bilang mga pagbabago sa tools, system, o messages prefix, mga pagbabago sa thinking configuration, at mga pagbabago sa output_config.effort. Hindi documented ang epekto ng model switch sa isang existing cache, kaya ituring itong unknown at basahin ang cache_read_input_tokens sa unang request pagkatapos nito. Mahalagang malaman ito: sa isang 150,000-token Opus 4.8 prefix, ang cache read ay nagkakahalaga ng humigit-kumulang $0.08 at ang fresh write ay humigit-kumulang $0.94, na mas mahal kaysa sa ilang turns ng per-token savings. Magpalit lamang sa pagitan ng mga task, pagkatapos ng /clear sa Claude Code, kung kailan sadyang tinatapon na ang cache.
Ano ang epekto ng output_config.effort sa bill ko?
Binabago nito kung ilang tokens ang ginagamit ng model para sa text, tool calls, at thinking. Ang mas mababang effort ay nagreresulta sa mas kaunting tool calls, na nagpapalala sa mga agentic loop dahil ang bawat tool result ay muling ipinapadala sa mga susunod na turns. Ang mga level ay low, medium, high, xhigh, at max, kung saan ang high ang default. Walang inilalathalang cost multiplier ang Anthropic bawat level; itinuturing ang effort bilang isang behavioural signal sa halip na token budget, kaya sukatin ito sa sarili mong task.
Magkano ang matitipid sa Claude Batches API?
50% sa parehong input at output tokens, kapalit ng asynchronous delivery. As of July 2026, ang Opus 4.8 ay nasa $2.50 in / $12.50 out, ang Sonnet 5 ay nasa $1 / $5 sa introductory pricing, at ang Haiku 4.5 ay nasa $0.50 / $2.50. Ang mahalagang comparison ay sa iba't ibang tiers: ang isang batched Opus 4.8 job ay mas mura kaysa sa isang synchronous Sonnet 5 job sa standard rate simula 1 September 2026, kaya ang batching ay nagbibigay ng mas malakas na model sa parehong halaga.