SSD Nodes Learn Hosting plans →
Mga Gabay Matt ConnorNi Matt Connor · Na-update 2026-08-13

Bakit mahal ang Claude? Token math at API cost

Mas mahal nang 5x ang output tokens kaysa input, at binabasa muli ang buong context sa bawat turn. Tingnan ang aktuwal na arithmetic at 4 na paraan para makatipid.

Bakit mahal ang Claude? Ang maikling sagot

Mahal ang Claude dahil sa apat na dahilan na nagsasama-sama. Limang beses ang rate ng output tokens kumpara sa input tokens. Walang memory ang API para sa conversation mo, kaya ipinapadala at sinisingil muli ang buong history sa bawat turn. Ginagawang dose-dosenang API call ng isang agent ang isang tanong, at dala ng bawat call ang history na patuloy na lumalaki. Bukod pa rito, ang presyo ng frontier model ay ibinabatay sa hirap ng gawaing ginagawa nito, hindi sa gastos ng pagpapatakbo ng maliit na model.

Ang token ay isang bahagi ng text. Bilang tantya, ang isang token ay humigit-kumulang apat na character, o 0.75 word sa English. Ipinapahayag ang mga rate kada million tokens, na isinusulat bilang MTok (million tokens). Ang lahat ng rate sa ibaba ay ang inilathalang Claude API rate noong August 2026.

Karamihan ng hindi inaasahang bill ay nagmumula sa pangalawa at pangatlong dahilan sa listahan. Karaniwang iniisip ng mga tao na ang mga sagot na isinusulat ng Claude ang pangunahing nagkakahalaga. Sa isang agent session, kadalasan ay mas mababa sa one tenth ng bill ang napupunta sa pagsusulat.

Ang mga naka-publish na rate, para pareho tayo ng batayan sa mga numero

ChartPublished Claude API rates, US dollars per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5,
    "cache_read_usd": "0.10"
  },
  {
    "label": "Sonnet 5, to Aug 31 2026",
    "input_usd": 2,
    "output_usd": 10,
    "cache_read_usd": "0.20"
  },
  {
    "label": "Sonnet 5, from Sep 1 2026",
    "input_usd": 3,
    "output_usd": 15,
    "cache_read_usd": "0.30"
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25,
    "cache_read_usd": "0.50"
  }
]

Tingnan ang pattern, hindi ang mga absolute na numero. Ang bawat model ay eksaktong limang beses ang singil sa output kumpara sa input. Ang Opus 5 ay nagkakahalaga ng 5 dollars bawat milyong input token at 25 dollars bawat milyong output token. Ang Haiku 4.5 ay nagkakahalaga ng 1 at 5. Kaya limang beses ang pagitan ng pinakamurang model at pinakamahal na model, at limang beses din ang pagitan ng pagbasa at pagsulat.

Nasa introductory pricing ang Sonnet 5 na 2 at 10 dollars bawat milyong token hanggang August 31, 2026. Simula September 1, 2026, magiging 3 at 15 ito. Nagbabago ang mga rate kapag may bagong model release, kaya tingnan ang kasalukuyang mga rate bago gumawa ng budget batay rito. Wala ring free tier sa ibaba ng table na ito, bagama't nagsisimula ang mga bagong account na may maliit na credit at walang bayad ang ilang bahagi ng API.

Ang huling column ay ang cache read rate. Ito ang may pinakamalaking epekto sa karamihan ng bill. Balikan natin ito pagkatapos ng arithmetic.

Bakit limang beses na mas mahal ang output tokens kaysa sa input tokens?

Hindi pareho ang dami ng trabahong kailangan sa pagbasa at pagsulat. Pinoproseso ang input tokens sa isang pass. Binabasa ng model ang buong prompt nang sabay-sabay, at tumatakbo nang parallel ang trabaho sa buong prompt. Kaya ang 60,000-token na prompt ay hindi nangangailangan ng 60,000 beses na mas mahabang oras para mabasa kaysa sa 1,000-token na prompt.

Isa-isang ginagawa ang output tokens. Kailangan ng bawat bagong token ng sarili nitong pass sa model, pati ng lahat ng token na nauna rito bilang context. Ang pagsulat ng 1,000 tokens ay nangangahulugan ng 1,000 pass na sunod-sunod. Hindi maaaring ipamahagi ang serial na trabahong ito gaya ng pagbasa, kaya mas matagal na ginagamit ng bawat output token ang hardware.

Dahil dito, mas mahina kaysa sa inaasahan ng marami ang epekto ng “paikliin ang sagot.” Nakakatulong ito sa mas maliit na bahagi ng gastos sa agent.

Bakit muling sinisingil ang buong conversation sa bawat turn?

Stateless ang Claude API. Walang conversation sa panig ng Anthropic na dinadagdagan mo ng isang message. Dala ng bawat request ang buong message history, at binabasa ng model ang lahat ng ito bago magsulat ng anuman. Kaya sinisingil sa turn 30 ang turn 1 hanggang 29.

Ibig sabihin, mas mabilis lumalaki ang cost ng conversation kaysa sa haba nito. Maliit na context ang sinisingil sa turn 1. Malaki naman ang sinisingil sa turn 40. Kapag pinagsama ang lahat ng 40 turn, nagbayad ka para sa maraming ulit ng kabuuang bilang ng tokens na naisulat.

ChartContext size at each turn of a 40 turn agent session
The data behind this chart
[
  {
    "turn": 1,
    "context_tokens": "20,000"
  },
  {
    "turn": 5,
    "context_tokens": "32,000"
  },
  {
    "turn": 10,
    "context_tokens": "45,000"
  },
  {
    "turn": 15,
    "context_tokens": "55,000"
  },
  {
    "turn": 20,
    "context_tokens": "64,000"
  },
  {
    "turn": 25,
    "context_tokens": "74,000"
  },
  {
    "turn": 30,
    "context_tokens": "84,000"
  },
  {
    "turn": 35,
    "context_tokens": "92,000"
  },
  {
    "turn": 40,
    "context_tokens": "100,000"
  }
]

Nagsisimula ang session sa itaas sa 20,000 tokens. Kasama rito ang system prompt, mga tool definition, at mga unang file na binuksan ng agent. Sa turn 40, naglalaman ang context ng 100,000 tokens. Kapag in-average ito sa lahat ng 40 turn, humigit-kumulang 60,000 tokens ang binabasa sa bawat request.

Bakit mas mahal nang malaki ang isang agent kaysa sa chat?

Isang request bawat tanong ang chat. Isang request bawat step ang agent. Step ang pagbasa ng file. Step ang pagpapatakbo ng test. Step ang pagbasa sa output ng test. Step ang pag-edit ng file. Karaniwan sa isang coding agent ang umabot sa 40 step para matapos ang isang task.

May dalawang dagdag na gastusin na kasama ng tool use. Input tokens ang mga tool definition sa bawat request, dahil kailangang sabihin sa model kung anong mga tool ang available sa bawat pagkakataon. Inilalathala ng Anthropic ang overhead: ang tool use system prompt ay 286 tokens sa Opus 5 kapag naka-set ang tool_choice sa auto, bukod pa sa tokens ng sarili mong tool schema. May hiwalay ding fee ang ilang server-side tool. Sisingilin ang web search ng $10 bawat 1,000 search, bukod pa sa tokens na ginagamit ng mga result.

Permanenteng bahagi rin ng context ang bawat tool result. Kapag nag-print ang isang command ng 3,000 linya, mapupunta ang 3,000 linyang iyon sa bawat request sa natitirang bahagi ng session. Makikita ito sa per-session token usage na iniuulat ng Claude Code: obserbahan kung paano tumataas ang input number kaagad pagkatapos ng noisy command.

Ang arithmetic sa isang aktuwal na session

Narito ang isang makatotohanang oras ng agentic coding sa Opus 5. Apatnapung API request ang ginawa. Lumalaki ang context mula 20,000 hanggang 100,000 token, kaya nasa average na 60,000 token bawat request. Humigit-kumulang 700 token ang sinusulat ng model bawat request. Binubuo ito ng maiikling tool call at ilang mas mahahabang code block.

Requests in the session:      40
Average context per request:  60,000 tokens

Total input tokens billed:    40 x 60,000                    = 2,400,000
Input cost on Opus 5:         2,400,000 x $5 / 1,000,000     = $12.00

Total output tokens:          40 x 700                       =    28,000
Output cost on Opus 5:        28,000 x $25 / 1,000,000       =  $0.70

Session total                                                = $12.70
ChartWhere the money went in one 40 turn Opus 5 session, no caching
The data behind this chart
[
  {
    "label": "Input, context re-read",
    "billed_tokens": "2,400,000",
    "cost_usd": "12.00"
  },
  {
    "label": "Output, code and tool calls",
    "billed_tokens": "28,000",
    "cost_usd": "0.70"
  }
]

Tingnan ang paghahati. 12.00 dollars ang reading cost at 0.70 dollars ang writing cost, kaya humigit-kumulang limang porsyento ng bill ang output na aktuwal mong nabasa. Sumulat ang model ng 28,000 token at siningil ito para sa pagbabasa ng 2,400,000 token. Walang nag-type ng 2.4 milyong token. Paulit-ulit na binasa ang parehong 100,000 token.

Lever 1: prompt caching, ang pinakamalaking epekto

Iniimbak ng prompt caching ang naprosesong anyo ng stable prefix ng prompt mo. Sa susunod na request, binabasa ang prefix na iyon mula sa cache sa halip na iproseso itong muli. Ang pagsusulat sa cache ay nagkakahalaga ng 1.25 beses ng input rate para sa five-minute cache, o 2 beses para sa one-hour cache. Ang pagbasa mula rito ay nagkakahalaga ng 0.1 beses ng input rate. Sa Opus 5, 0.50 dollars ito bawat milyon sa halip na 5 dollars.

Ilapat ito sa session sa itaas. Isinusulat sa cache nang isang beses ang bawat isa sa 100,000 token habang lumalaki ang conversation. Ang natitirang 2,300,000 input token ay nagiging cache read.

Tokens written to cache:      100,000
Cache write at 1.25x input:   100,000 x $6.25 / 1,000,000    = $0.63

Tokens read from cache:       2,300,000
Cache read at 0.1x input:     2,300,000 x $0.50 / 1,000,000  = $1.15

Output cost, unchanged                                       = $0.70

Session total                                                = $2.48

Itinatakda mo ang bahaging puwedeng i-cache gamit ang field na cache_control. Ilagay ang breakpoint pagkatapos ng content na hindi nagbabago sa pagitan ng mga turn: ang system prompt at ang tool definitions. Ang mahabang dokumentong palagi mong tinutukoy ay dapat mapunta sa kaparehong stable block.

{
  "model": "claude-opus-5",
  "system": [
    {
      "type": "text",
      "text": "<long, stable instructions>",
      "cache_control": {"type": "ephemeral"}
    }
  ],
  "messages": [{"role": "user", "content": "..."}]
}

Ang pagkakaayos ng prompt mo ngayon ang nagtatakda ng gastos. Kailangan ng cache hit ng eksaktong match mula sa pinakasimula ng prompt, kaya dapat ilagay ang anumang nagbabago sa bawat request pagkatapos ng lahat ng hindi nagbabago. Kapag naglagay ka ng timestamp sa itaas ng system prompt, masisira ang cache sa bawat turn: magiging miss ang buong prefix, at magbabayad ka ng 1.25 beses ng input rate para maisulat itong muli.

Ipinapakita ng response kung gumana ito. Magpadala ng request at basahin ang usage block.

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 256,
    "messages": [{"role": "user", "content": "Hello"}]
  }'

May dalang usage object ang bawat response, gaya nito:

{
  "usage": {
    "input_tokens": 105,
    "cache_creation_input_tokens": 7345,
    "cache_read_input_tokens": 7123,
    "output_tokens": 239
  }
}

Kapag ang repeat request ay nagpapakita pa rin ng 0 sa cache_read_input_tokens, hindi ginagamit ang cache. Karaniwang sanhi nito ang pagbabago ng isang bagay bago ang breakpoint. Nag-e-expire din ang five-minute cache, kaya ang request na ipinadala pagkalipas ng anim na minuto ay magiging miss na susundan ng panibagong write.

Lever 2: ipadala ang mga madaling turn sa mas maliit na model

Hindi mahirap ang karamihan sa mga turn sa isang agent session. Halimbawa nito ang pagbubukas ng file, pagpapatakbo ng formatter, at pagbasa ng diff. Hindi kailangan ng mga ito ang frontier model. Kapag ipinasa ang mga ito sa Haiku 4.5, bababa ang input rate mula 5 dollars bawat milyon hanggang 1.

ChartThe same 40 turn session under four setups, US dollars
The data behind this chart
[
  {
    "label": "Opus 5, no caching",
    "session_cost_usd": "12.70"
  },
  {
    "label": "Opus 5, cached",
    "session_cost_usd": "2.48"
  },
  {
    "label": "Sonnet 5, cached",
    "session_cost_usd": "0.99"
  },
  {
    "label": "Haiku 4.5, cached",
    "session_cost_usd": "0.50"
  }
]

Ang parehong session ay nagkakahalaga ng 12.70 dollars sa Opus 5 nang walang caching, 2.48 na may caching, 0.99 sa Sonnet 5 na may caching, at 0.50 sa Haiku 4.5 na may caching. Ang caching lang ay nag-aalis ng humigit-kumulang 80 porsiyento ng bill. Inaalis ng pagpili ng model ang malaking bahagi ng natitira.

Narito ang tapat na caveat. Kung mali ang sagot ng mas murang model, gagastos ka ulit para sa buong session, pati ang sarili mong oras. I-route ang mga turn batay sa hirap ng task, hindi sa presyo. Nalalapat din ang panuntunan kapag mas mataas ang antas: mas mataas ang list price ng Claude Fable 5 kaysa sa Opus 5, na nasa $10 at $50 bawat milyon, kaya basahin ang kung ano ang naibibigay ng mga rate na iyon bago mo ipadala roon ang isang turn. Tinatalakay sa Pagpili sa pagitan ng Opus, Sonnet at Haiku kung saan mahusay ang bawat isa.

Lever 3: hygiene ng context

Bawat token na iniiwan mo sa context ay sinisingil sa bawat natitirang turn. Kaya mas malaki ang pakinabang ng maagang pag-alis ng token kaysa sa pag-alis nito nang huli. Ang file na may 5,000 token na inilagay sa turn 5 ng 40-turn session ay mababasa pa nang 35 beses. Iyon ay 175,000 karagdagang input token, na halos isang dollar sa Opus 5 dahil sa isang pabigla-biglang paste.

Apat na gawi ang makapagpapabago sa bilang:

  • Magsimula ng bagong session para sa bagong task sa halip na ipagpatuloy ang session kahapon.
  • I-filter ang maingay na command bago makarating ang output sa model, gamit ang gaya ng head -50, sa halip na pagkatapos.
  • Hingin ang isang function na kailangan mo, hindi ang buong file.
  • Kapag hindi na umuusad ang isang mahabang session, humingi ng summary at magsimulang muli mula rito. Ilang daang token lamang ang summary. Isang daang libong token ang transcript.

Lever 4: i-batch ang lahat ng hindi interactive

Pinoproseso ng Batch API ang mga request nang asynchronous at nagbibigay ng 50 percent na bawas sa input at output. Kung hindi kailangan ng isang job ng sagot sa loob ng susunod na segundo, i-batch ito. Kasama rito ang classification, extraction, pagbuo ng buod mula sa backlog, at evaluation runs. Naiipon ang batch discount kasama ng prompt caching. Hindi ito naaangkop sa interactive session dahil walang kailangang hintayin doon.

Niloloko ba ako sa singil?

Iyan ang tunay na tanong sa likod ng “bakit mahal ang Claude,” kaya narito ang tuwirang sagot. Naka-publish ang mga rate, pareho ang mga ito para sa lahat sa standard tiers, at sinisingil ang mga ito bawat token. Ang exception ay isang negotiated contract. Kahit doon, naglalagay ang Claude Enterprise pricing ng per-seat charge sa parehong metered tokens sa halip na palitan ang mga ito. Walang discretionary na bahagi sa bill. Hindi masasabi ng rate card kung sulit ang nakukuha mo, dahil tokens ang pinapresyuhan nito samantalang outcomes ang mahalaga sa iyo.

Kaya ang dapat mong presyuhan ay ang outcome. Ang session sa itaas ay nagkakahalaga ng 12.70 dollars nang walang caching. Kung naghatid ito ng feature na aabutin sana ng isang oras para gawin mo, mura iyon. Kung umabot ito sa 40 turns na paikot-ikot lang, walang napala sa parehong 12.70 dollars, at hindi rate ang naging problema.

Ito ang dapat tandaan. Naka-scale ang bill mo batay sa tokens, hindi sa value. Pareho ang halaga ng isang productive session at isang nasayang na session kung pareho ang haba ng mga ito. Kaya mas mahalaga ang apat na lever kaysa sa rate card: hindi mo maaaring tawaran ang presyo bawat token, pero ikaw ang nagpapasya kung ilang token ang kakailanganin ng trabaho.

Kaya subaybayan ang dollars bawat nakumpletong task, hindi dollars bawat buwan. Kung bumababa ang numerong iyon habang tina-tune mo ang caching at routing, gumaganda ang setup mo kahit tumataas ang monthly total, dahil tumataas ang kabuuan dahil mas marami kang natatapos na trabaho.

Ano ang hindi nagpapababa ng bill

Kaunti lang ang naitutulong ng ilang popular na payo. Kapag sinabihan ang model na “maging maikli,” nababawasan ang output, pero 5 percent lamang ng halimbawang bill ang output. Ang pagpapaikli sa sarili mong tanong ay nakakatipid lang ng ilang daang token mula sa 60,000-token na context. Nakakatulong ang pag-off ng extended thinking kapag malaking bahagi talaga ng output mo ang thinking tokens. Ipinapakita iyon ng usage block para hindi mo kailangang manghula.

Hindi rin awtomatikong dagdag-gastos ang mas malaking context window. Sa Claude 4.6 at mga mas bagong bersyon, sinisingil ang buong one million token window sa standard per-token rate. Kaya pareho ang per-token cost ng 900,000-token request at 9,000-token request. Hindi itinatakda ng laki ng window ang presyo. Ang inilalagay mo sa window ang nagtatakda nito.

May dalawa pang bagay na dapat pagplanuhan, hindi ayusin sa iisang session. Kung araw-araw at interactive ang paggamit mo, ihambing ang pay per token sa flat plan: ginagawa ng paghahambing ng gastos sa API at subscription ang kalkulasyong iyon. Kung mas mainam ang flat plan at kasabay mong isinasaalang-alang ang ibang vendor, inihahambing ng magkatabing presyo ng mga plan ng Claude at ChatGPT ang parehong opsyon. Kung unattended na tumatakbo ang isang agent sa server, magtakda muna ng hard spend cap bago baguhin ang iba pang setting. Iyan ang tinatalakay sa mga cost control para sa AI agent sa VPS. Para sa malinaw na ideya tungkol sa laki, ginagawang mga pahina ng text ng kung ano talaga ang mabibili ng one million Claude token ang rate card.

FAQ

Bakit biglang tumaas ang bill ko sa Claude nang magsimula akong gumamit ng agent?

Dahil maraming request ang ipinapadala ng agent para sa bawat tanong, at kasama sa bawat request ang buong conversation hanggang sa puntong iyon. Isang request lang ang ipinapadala ng chat para sa bawat tanong. Isang request naman ang ipinapadala ng coding agent sa bawat step, at normal ang 40 step para sa isang task. Bina-bill ang bawat request batay sa buong context nito, kaya ang session na nagtatapos sa 100,000 token ay maaaring masingil ng mahigit dalawang milyong input token sa kabuuan. Basahin ang input_tokens at cache_read_input_tokens sa API response para makita ito nang direkta.

Malaki ba talaga ang naibabawas ng prompt caching sa bill?

Sa worked example, ibinaba nito ang gastos sa session mula 12.70 dollar tungo sa 2.48 dollar, dahil ang halaga ng cache read ay isang-sampu ng input rate. Ganap na nakadepende ang matitipid sa hit rate mo. Sa five minute cache, sulit na ito pagkatapos ng isang read dahil 1.25 beses ng input rate ang write cost at 0.1 beses naman ang read cost. Kung nagbabago ang prompt malapit sa simula sa bawat request, wala kang makukuhang hit at masasayang lang ang dagdag na bayad para sa write. Kumpirmahin gamit ang cache_read_input_tokens bago mo ipagpalagay na gumagana ito.

Dapat ko bang gamitin na lang ang Haiku para sa lahat?

Hindi. 1 dollar ang halaga ng Haiku 4.5 bawat milyong input token, kumpara sa 5 para sa Opus 5, kaya tunay ang matitipid sa simple at high-volume na gawain gaya ng classification at routing. Mas mahal ang maling sagot sa mahirap na gawain kaysa sa natipid ng model, dahil magbabayad ka para sa retry at sa sarili mong oras bukod pa rito. Ang pattern na karaniwang gumagana ay mixed: ang maliit na model para sa mechanical na mga turn, at ang frontier model para sa turn na nangangailangan ng judgment.

Mas mura ba ang API kaysa sa Claude subscription?

Depende ito sa kung gaano ka-consistent ang paggamit mo. Ang subscription ay may fixed na buwanang presyo at may kalakip na usage limits. Ang API ay pay per token at walang ceiling, kaya mas mura ito kapag kaunti o pa-burst ang paggamit mo, at mas mahal kapag mabigat ang paggamit mo sa bawat araw ng trabaho. Kunin ang average na token bawat araw mula sa usage block, i-presyo ang mga ito batay sa rate ng model mo, pagkatapos ay ikumpara ang halagang iyon sa presyo ng plan, na para sa entry tier ay nakasaad sa kung magkano ang Claude Pro at kung saan ka nililimitahan ng mga usage limit nito. Kung mas pabor sa API ang kabuuang halaga, ang pagkansela ng plan o pagbaba sa mas mababang tier ay hindi nangangahulugang masasayang ang buwan na nabayaran mo na, dahil mananatili ang access mo hanggang sa katapusan ng kasalukuyang billing period.