SSD Nodes Learn Hosting plans →
Mga Gabay Matt ConnorNi Matt Connor · Na-update 2026-08-27

Aling Claude model ang dapat gamitin? Gabay sa presyo

Opus 4.8, Sonnet 5 o Haiku 4.5? Tingnan ang rates noong July 2026, cost comparison sa 100,000 jobs, at settings na pinakamalaking nagpapataas ng bill.

Aling Claude model ang dapat kong gamitin?

Ang maikling sagot sa tanong kung aling Claude model ang dapat mong gamitin: magsimula sa Claude Opus 4.8, at lumipat lamang dito kung may malinaw kang dahilan. Ganito rin ang gabay ng Anthropic. “Kung hindi ka sigurado kung aling model ang gagamitin, magsimula sa Claude Opus 4.8 para sa kumplikadong agentic coding at enterprise work.” Lumipat sa Claude Sonnet 5 kapag malinaw ang task at maraming beses mo itong pinapatakbo bawat araw. Lumipat naman sa Claude Haiku 4.5 para sa mekanikal at high-volume na trabaho kung alam mo na kung ano ang tamang sagot. Ang Claude Fable 5 ang pinakamataas sa mga ito at para sa mga agent na matagal tumatakbo.

May katumbas na presyo ang pagpili. Ito ang mga rate sa Claude API (application programming interface) noong 23 July 2026, bawat milyon ng tokens, na isinusulat ng documentation bilang MTok.

  • Claude Fable 5 (claude-fable-5): $10 / MTok para sa input, $50 / MTok para sa output. 1M context.
  • Claude Opus 4.8 (claude-opus-4-8): $5 para sa input, $25 para sa output. 1M context.
  • Claude Opus 4.7 (claude-opus-4-7): $5 para sa input, $25 para sa output. 1M context.
  • Claude Sonnet 5 (claude-sonnet-5): $2 para sa input, $10 para sa output sa introductory pricing hanggang 31 August 2026. Ang standard na $3 para sa input at $15 para sa output ay magkakabisa sa 1 September 2026. 1M context.
  • Claude Haiku 4.5 (claude-haiku-4-5): $1 para sa input, $5 para sa output. 200K context.

Kumpleto ang mga identifier na iyon sa pagkakasulat sa mga ito. Walang idinadagdag sa mga ito.

Walang dagdag-singil batay sa laki sa mga 1M-token model: “Pareho ang per-token rate ng 900k-token request at 9k-token request.” Umaabot din sa labas ng API ang mga rate na ito, dahil sinusukat ng Claude Enterprise ang usage gamit ang API rates bukod sa bayad sa seat, kaya pareho ang arithmetic sa ibaba para sa team na nasa seat plan. Binabago ng flat-rate subscription ang paraan ng pagsukat, pero hindi ang desisyong ito, dahil parehong may mga model ang dalawang Claude Max tier at nagkakaiba lamang sa dami ng usage na kasama. Sa mas mababang bahagi ng parehong ladder, ang $20 bawat buwan ng Claude Pro ay nagbibigay ng usage allowance sa halip na per-token rate, kaya limit reset at hindi bill ang pumipigil sa iyo roon. Kung iyon ang sitwasyon mo ngayon, alamin muna kung aling window ang hinihintay mo bago gawin ang anumang arithmetic sa ibaba, dahil ang solusyon ay mas maliit na model, mas maliit na context, o paglipat sa API sa halip na mas murang rate. At kung hindi ka pa nagsisimulang magbayad, ang tanong kung sulit ba ang $20 para sa Pro ay nakabatay sa kung gaano kadalas kang pinipigilan ng free limit, hindi sa alinman sa mga rate sa itaas.

Para saan talaga ang bawat model

Inilalarawan ng Anthropic ang lineup sa tig-iisang linya para sa bawat model, at mas mahusay na gabay ang mga linyang iyon kaysa sa anumang leaderboard.

  • Claude Fable 5: “Next-generation intelligence para sa mga agent na matagal tumakbo.” Ito ang may pinakamabagal na latency sa apat.
  • Claude Opus 4.8: “Para sa kumplikadong agentic coding at enterprise work.” Katamtaman ang latency.
  • Claude Sonnet 5: “Pinakamahusay na kombinasyon ng bilis at intelligence.” Mabilis.
  • Claude Haiku 4.5: “Pinakamabilis na model na may intelligence na halos kapantay ng frontier.”

Ang Fable 5 lang sa apat ang hindi kailanman sinisingil ng comparison na ito batay sa isang workload. Dahil doble ang rate nito kumpara sa Opus 4.8, nararapat ng hiwalay na sagot ang tanong kung aling mga trabaho ang sulit sa $10 na gastos para kumita ng $50.

May mga limitasyon din ang Haiku 4.5 na unang tumutukoy kung angkop ito sa isang trabaho, bago pa ikonsidera ang presyo. 200K tokens ang context window nito sa halip na 1M, kaya hindi kasya ang malaking repository o mahabang agent transcript. 64K tokens din ang maximum output nito sa synchronous Messages API, kumpara sa 128K ng iba. Ang maaasahang knowledge cutoff nito ay February 2025, samantalang January 2026 ang cutoff ng tatlo pa.

Magkano ang magiging gastos ng bawat pagpipilian sa aktuwal na workload?

Ang bawat model sa lineup ay naniningil ng limang beses na input rate para sa output. Ang Opus 4.8 ay $5 para sa input at $25 para sa output. Ang Haiku 4.5 ay $1 para sa input at $5 para sa output. Pareho ang ratio sa buong range, kaya pinakamahalaga ang napili mong model sa mga workload na gumagawa ng maraming output.

Ganito ang agentic work dahil sinisingil bilang output tokens ang thinking tokens at ibinibilang sa max_tokens kahit hindi kailanman makarating sa iyo ang text. Sa Fable 5, Opus 4.8, Opus 4.7, at Sonnet 5, hindi kasama bilang default ang reasoning summary, kaya walang laman ang thinking field. Hindi nagbabago ang billing: "Pareho pa rin ang singil sa block at pareho rin itong ipinapasa pabalik sa mga multi-turn conversation." Hinahati nang buo ng Ano talaga ang bumubuo sa Claude token bill ang meter na iyon.

Magkakaiba sa mga model na ikinukumpara mo kung awtomatikong tumatakbo ang thinking. Masisira ang cost test kung hindi mo ito mapapansin. Sa Sonnet 5 at Fable 5, naka-on na ang thinking at hindi na kailangan ng configuration. Sa Opus 4.8 at Opus 4.7, naka-off ito hanggang itakda mo ang thinking: {type: "adaptive"} sa request. Itugma muna ang configuration sa magkabilang panig bago bigyang-kahulugan ang mga numero.

Bakit maaaring maging pinakamahal ang pinakamurang model

Isang self-contained na coding task ang gamitin natin. May 60,000 tokens ng context ang request, at gumagawa ang model ng 8,000 tokens ng output kasama ang thinking. Walang caching, kaya malinaw ang arithmetic.

Sa Opus 4.8: ang 0.06 MTok ng input sa halagang $5 ay $0.30, at ang 0.008 MTok ng output sa halagang $25 ay $0.20. Ang isang attempt ay nagkakahalaga ng $0.50. Sa Haiku 4.5, ang parehong attempt ay $0.06 dagdag ang $0.04, kaya $0.10.

Limang beses na mas mura ang Haiku bawat attempt. Mukhang malaki ang matitipid hanggang sa suriin mo ang epekto ng failed attempt. Babasahin mo ang maling sagot, na kumokonsumo ng oras mo. Ipapadala mo itong muli bilang context sa retry, kaya mas malaki ang bawat attempt kaysa sa nauna. At kapag hindi pa rin tama ang ikatlong attempt, mag-e-escalate ka pa rin: $0.30 para sa Haiku dagdag ang $0.50 para sa Opus ay $0.80, o 60% na mas mahal kaysa sa isang run ng Opus.

Kaya ang mahalagang tanong ay kung gaano kamura mong mava-validate ang sagot. Kapag halata sa loob ng isang segundo ang maling sagot, sulit ang small model. Kapag kailangan mong basahing mabuti ang diff para matukoy ito, kumokonsumo ng oras ang small model—oras na hindi lumalabas sa invoice.

Kung saan talagang mas mahusay ang mas maliit na model

Ang Haiku 4.5 ang tamang piliin sa mga sitwasyong ito:

  • Mechanical na gawain ng subagent. Ang subagent na nagpapalit ng pangalan ng mga file o kumukuha ng search output ay hindi nangangailangan ng frontier reasoning. Ito ang karaniwang pattern kapag bumubuo ka ng AI agent gamit ang Claude at binibigyan ito ng mga helper.
  • Pag-triage ng log. Ang pagpapasya kung noise lamang ang isang linya o kailangan itong suriin ng tao ay isang makitid na judgment na may malinaw na failure mode.
  • Classification gamit ang fixed label set. Maikli ang output, at nasusukat ang accuracy gamit ang sample.
  • Mga production call na mataas ang volume. Sa 100,000 run bawat araw, hindi na rounding error ang diperensiya sa bawat token. Ito ang karaniwang anyo ng AI workflow na naka-wire sa n8n.
  • Anumang sitwasyon kung saan mahalaga sa user ang bilis ng response. Ang Haiku 4.5 ang itinuturing na pinakamabilis na model sa lineup.

May isang limitasyon na partikular sa Haiku. Ang minimum cacheable prompt nito ay 4,096 token, kumpara sa 1,024 sa Opus 4.8 at Sonnet 5. Mas mababa rito, “any requests to cache fewer than this number of tokens will be processed without caching, and no error is returned”. Ang instruction block na may 1,500 token at naca-cache sa Sonnet 5 ay tahimik na hindi naca-cache sa Haiku 4.5. Makikita ito kapag parehong nasa zero ang cache_creation_input_tokens at cache_read_input_tokens. Tinatalakay ng pagpapanatiling mababa sa gastos ng isang always-on agent ang puntong ito kasama ng iba pang paraan para mawalan ng cache.

Mga setting na nagbabago sa sagot

Ang bawat isa sa mga setting na ito ay mas nakaaapekto sa bill kaysa sa pangalan ng model.

Effort. Kinokontrol ng output_config.effort kung gaano karaming trabaho ang ginagawa ng model bago ito sumagot. Ang mga level ay low, medium, high, xhigh, at max, at ang high ang default: “Kapag itinakda ang effort sa high, eksaktong kapareho ito ng behavior kapag tuluyang inalis ang parameter na effort.” Nasa loob ito ng output_config sa halip na nasa top level ng request:

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    messages=messages,
)

Naaapektuhan ng effort ang bawat token sa response: “Maaari nitong maapektuhan ang lahat ng token spend, kabilang ang mga tool call. Halimbawa, mas kaunting effort ang nangangahulugang mas kaunting tool call ang gagawin ni Claude.” Lalong lumalaki ang epekto nito sa agentic loop. Hindi ito token cap: “Ang effort ay behavioral signal, hindi mahigpit na token budget.” Walang inilalabas ang Anthropic na cost multiplier para sa bawat level at sinasabihan kang subukan ang sarili mong use case. Kaya ang Sonnet 5 run sa high kumpara sa Opus 4.8 run sa low ay isang aktuwal na paghahambing na maaari mong patakbuhin ngayong hapon. Wala ang Haiku 4.5 sa listahan ng mga model na sumusuporta sa effort.

Prompt caching. Ang cache read ay nagkakahalaga ng 0.1x ng base input rate. Ang mahalaga sa pagpili ng model ay kung ano ang epekto nito sa iba’t ibang tier. Ang cache hit sa Opus 4.8 ay nagkakahalaga ng $0.50 / MTok, habang ang uncached input sa Haiku 4.5 ay nagkakahalaga ng $1 / MTok. Dahil dito, mas mura kada input token ang prefix ng Opus na maayos na naka-cache kaysa sa cold prompt ng Haiku. Sa workload na paulit-ulit na nagpapadala ng malaking stable prefix, mas mahalaga ang maayos na session hygiene kaysa sa pagpili ng model.

Batches. Kung walang naghihintay sa sagot, pinapatakbo ng Message Batches API ang parehong mga model na may “50% discount sa input at output tokens.” Hinahati nito sa kalahati ang bawat row sa paghahambing sa ibaba, at gumagana ito sa iba’t ibang tier. Mas mura ang isang batched Opus 4.8 job kaysa sa isang synchronous Sonnet 5 job sa standard price mula 1 September 2026. Ang kapalit nito ay mas mataas na latency para sa parehong halaga, kapalit ng mas mataas na capability.

Isang aktuwal na paghahambing ng gastos

Ang workload: pag-classify ng 100,000 support email, tig-isang call, na may 2,000 input token at 300 output token bawat call. Katumbas ito ng 200 MTok na input at 30 MTok na output.

  • Haiku 4.5: 200 x $1 = $200 na input, 30 x $5 = $150 na output. Kabuuan: $350.
  • Sonnet 5, introductory rate: 200 x $2 = $400 na input, 30 x $10 = $300 na output. Kabuuan: $700.
  • Sonnet 5, simula 1 September 2026: 200 x $3 = $600 na input, 30 x $15 = $450 na output. Kabuuan: $1,050.
  • Opus 4.8: 200 x $5 = $1,000 na input, 30 x $25 = $750 na output. Kabuuan: $1,750.

Palitan ang apat na numero upang ulitin ang kalkulasyon gamit ang mga presyo bukas. Mas malaki pa sa epekto ng model name ang mga adjustment sa ibaba:

  • Hinahati ng batching sa kalahati ang bawat linya: $175, $350, $525 at $875. Walang naghihintay sa nightly classification run, kaya walang dahilan upang hindi ito gamitin.
  • Pag-cache ng shared prefix. Ipagpalagay na 1,200 sa 2,000 input token ang parehong instruction block sa bawat pagkakataon. Sa Sonnet 5 gamit ang introductory rate, nagkakahalaga ang mga ito ng $0.20 / MTok bilang cache hit sa halip na $2 / MTok, kaya ang 120 MTok ay nagkakahalaga ng $24 sa halip na $240. Magdagdag ng 80 MTok na bagong input sa halagang $2, o $160, kasama ang $300 na output, at magiging humigit-kumulang $484 ang gastos sa Sonnet 5 sa halip na $700. Walang epekto ang parehong technique sa Haiku 4.5 dahil mas mababa sa minimum nitong 4,096 token ang 1,200 token.
  • Retries. Ipagpalagay na nire-reject mo ang sagot ng Haiku sa 8% ng mga email at pinapatakbo muli ang mga iyon sa Opus 4.8. Magdagdag ng 0.08 x $1,750 = $140 sa $350, kaya magiging $490. Sukatin ang sarili mong rejection rate sa halip na gamitin ang rate ko.
  • Tool definitions, kung ginagamit ng job. Ang system prompt na ginagawa ng mga ito ay 290 token sa Opus 4.8 kapag ang tool_choice ay nakatakda sa auto, 354 sa Sonnet 5 at 496 sa Haiku 4.5. Ang pinakamurang model ang may pinakamalaking fixed overhead.

Pareho ang gastos ng Haiku na may escalation path na $490 at cached Sonnet 5 na $484, at isa sa mga ito ang nakakagawa ng trabaho sa isang pass. Hindi kailanman ang model ang buong usapin.

Mas nakakatipid ba kapag nagpapalit ng model sa kalagitnaan ng session?

Mas madalang ito kaysa ipinahihiwatig ng mga nakalistang presyo, dahil kada token ang pagtitipid habang buong naka-cache na prefix ang maaaring mawala.

Idinodokumento ng Anthropic kung ano ang nag-iinvalidate ng cache. Binubuo ang mga prefix sa ganitong pagkakasunod-sunod: tools, pagkatapos ay system, at pagkatapos ay messages. Nakasaad din na, “Ang pagbabago sa bawat level ay nag-iinvalidate sa level na iyon at sa lahat ng kasunod na level.” Kasama rin sa listahan ang 2 request setting: “Ang thinking configuration at ang na-resolve na effort level ay nire-render mismo sa prompt, kaya ang pagbabago sa alinman sa mga ito ay nagsisimula ng bagong cache prefix.” Para sa effort, mas malinaw pa ang dokumentasyon: “Iba-ibahin ang effort sa magkakaibang workload, sa halip na sa loob ng isang conversation na umaasa sa cache hits.”

Wala sa dokumentadong listahan ang model, kaya huwag awtomatikong ipalagay kung kabilang ito o hindi. Basahin ang cache_read_input_tokens sa unang request pagkatapos ng pagpapalit at doon ibatay ang sagot. Para sa 150,000-token na Opus 4.8 prefix, humigit-kumulang $0.08 ang halaga ng cache read at $0.94 naman ang bagong write. Mas malaki ito kaysa sa halaga ng ilang turn mula sa per-token gap na sinusubukan mong makatipid.

Kaya gawin ang mga pagbabagong ito sa pagitan ng mga task, hindi sa loob ng iisang task. Sa Claude Code, nangangahulugan ito na /clear muna, kapag itinatapon na rin ang cache, at saka /model o /effort. Pareho itong tina-type sa CLI. Kung Linux ang gamit mo, ang terminal installation ang dapat mong piliin, dahil ang native na ipinapadala ng Anthropic para sa Linux ay may stable na CLI habang beta pa ang desktop app. Kung lalabas man sa bill ang pagpapalit, nakadepende ito sa paraan ng pagbabayad mo para sa session. Ang Claude Code ay maaaring gumamit ng flat monthly plan o per-token API credits, at ang pangalawang opsyon lamang ang naniningil ng dolyar para sa pagpapalit ng model.

Paano subukan ang sagot sa sarili mong workload

Huwag magtakda ng laki ng prompt gamit ang bilang mula sa ibang model. Libre gamitin ang token-counting endpoint, at nagbibilang ito gamit ang tokenizer ng model na iyong tinukoy, kaya pangalanan ang model na balak mong tawagan. Isa ito sa iilang bahagi ng platform na hindi kailanman naniningil, at sulit tingnan ang iba pang puwede mong patakbuhin nang walang bayad bago ka gumastos ng aktuwal na credit para sa paghahambing. Gumagamit ang Opus 4.7 at mga mas bagong bersyon, Fable 5, at Sonnet 5 ng mas bagong tokenizer na “gumagawa ng humigit-kumulang 30% mas maraming token para sa parehong text,” kaya mababa ang lalabas na budget sa mas bagong model kung sinukat ito sa mas lumang model at hindi nagbago ang rate bawat token.

Pagkatapos, basahin ang resulta. Ang input_tokens ay ang bahaging hindi naka-cache lamang, kaya ang aktuwal na laki ng prompt ay ang field na iyon, dagdag ang cache_creation_input_tokens at cache_read_input_tokens. Ang unang Claude API app sa isang VPS ang pinakamaliit na maaasahang lugar para isagawa ang pagsukat na iyon, at ang kung aling Claude plan ang angkop sa paggamit mo ay hiwalay na desisyon tungkol sa kung magbabayad ka ba bawat token. Kung mauwi ito sa tanong kung aling subscription ang dapat mong panatilihin sa halip na kung dapat kang magkaroon nito, ipinapaliwanag ng mga tier ng Claude na itinabi sa presyo ng ChatGPT kung magkano ang parehong coding work sa mga seat ng kabilang provider. Kung ililipat ng pagsukat ang iyong workload sa API nang tuluyan, ang pagbaba ng subscription sa mas mababang tier o tuluyang pagkansela nito ay mag-iiwan pa rin sa iyo ng panahong nabayaran mo na, kaya walang penalty sa pagdedesisyon kapag mayroon na ang mga numero.

FAQ

Aling Claude model ang pinakamainam para sa coding?

Ang Claude Opus 4.8 ang dokumentadong panimulang pagpipilian para sa kumplikadong agentic coding, sa halagang $5 bawat milyong input token at $25 bawat milyong output token noong July 2026. Itinuturing ang Claude Sonnet 5 na pinakamainam na kombinasyon ng bilis at intelligence. Sa halagang $2 / $10 hanggang 31 August 2026, wala pang kalahati ang gastos nito. Patakbuhin ang parehong task sa dalawang model, panatilihing pareho ang thinking configuration, at ikumpara ang kabuuang token spend mula sa response.usage.

Sapat bang mura ang Claude Haiku 4.5 para ipalit sa Sonnet 5?

Sa bawat token, oo: $1 / $5 ito kumpara sa $2 / $10 para sa Sonnet 5 sa introductory pricing, o $3 / $15 simula 1 September 2026. Ang limits ang magpapasya. May 200K token context window ang Haiku 4.5 sa halip na 1M, 64K ang maximum output nito sa synchronous Messages API, February 2025 ang reliable knowledge cutoff nito, wala itong support para sa output_config.effort, at nangangailangan ito ng minimum na 4,096-token cacheable prompt na tahimik na nagdi-disable ng caching sa maiikling system prompt.

Makakatipid ba kung lilipat sa mas murang Claude model sa kalagitnaan ng session?

Mas madalang kaysa sa inaakala. Ayon sa dokumentasyon ng Anthropic, ang mga cache invalidator ay mga pagbabago sa tools, system o messages prefix, mga pagbabago sa thinking configuration, at mga pagbabago sa output_config.effort. Hindi dokumentado kung ano ang epekto ng paglipat ng model sa kasalukuyang cache, kaya ituring itong hindi alam at basahin ang cache_read_input_tokens sa unang request pagkatapos nito. Mahalagang malaman ito: sa 150,000-token na Opus 4.8 prefix, humigit-kumulang $0.08 ang halaga ng cache read at humigit-kumulang $0.94 ang fresh write. Mas malaki ito kaysa sa matitipid sa ilang turn gamit ang mas mababang per-token rate. Lumipat sa pagitan ng mga task, pagkatapos ng /clear sa Claude Code, kapag itinatapon na rin ang cache sa anumang kaso.

Ano ang epekto ng output_config.effort sa bill ko?

Binabago nito kung ilang token ang ginagastos ng model sa text, tool call, at thinking. Sa mas mababang effort, mas kaunti ang tool call. Lumalaki ang epekto nito sa agentic loop dahil ipinapadala muli ang bawat tool result sa mga susunod na turn. Ang mga level ay low, medium, high, xhigh at max, habang high ang default. Walang inilalabas na cost multiplier bawat level ang Anthropic. Itinuturing nito ang effort bilang behavioral signal, hindi token budget, kaya sukatin ito sa sarili mong task.

Magkano ang matitipid sa Claude Batches API?

50% sa input at output token, kapalit ng asynchronous delivery. Noong July 2026, nangangahulugan ito ng $2.50 in / $12.50 out para sa Opus 4.8, $1 / $5 para sa Sonnet 5 sa introductory pricing, at $0.50 / $2.50 para sa Haiku 4.5. Ang mahalagang paghahambing ay nasa pagitan ng mga tier: mas mura ang isang batched Opus 4.8 job kaysa sa synchronous Sonnet 5 job sa standard rate simula 1 September 2026. Sa gayon, nakakakuha ka ng mas malakas na model sa parehong halaga kapag gumagamit ng batching.