Waarom kosten Claude output-tokens meer dan input-tokens?
Output-tokens bij Claude zijn vijf keer duurder dan input-tokens. Ontdek hoe het verschil tussen prefill en decoding uw maandelijkse factuur beïnvloedt en bereken uw kosten.
Waarom output-tokens meer kosten dan input-tokens
Output-tokens kosten vijf keer zoveel als input-tokens bij elk Claude-model in de huidige catalogus. De oorzaak hiervan is de vorm van de berekening. Het lezen van een prompt is één doorloop door het model. Het schrijven van een antwoord is één doorloop per token, waarbij elke doorloop moet wachten op de voorgaande.
Deze verhouding is gelijk voor elke rij in de prijslijst, dus het model dat u kiest, verandert niets aan het aandeel van de output in uw factuur. De vorm van uw workload bepaalt dit. Een agent-stap die 60,000 tokens leest en antwoordt met 800 tokens, geeft bijna niets uit aan output. Een schrijfopdracht die 2,000 tokens leest en 12,000 tokens schrijft, geeft bijna niets uit aan input. Beide gevallen worden hieronder uitgewerkt op basis van de gepubliceerde tarieven van Anthropic van augustus 2026.
Prefill wordt eenmaal uitgevoerd, decoding eenmaal per token
Een inference-server verwerkt een verzoek in twee fasen met sterk uiteenlopende kosten. Prefill leest de prompt. Decoding schrijft het antwoord.
Prefill verwerkt de volledige prompt in één keer. Elk prompt-token komt in dezelfde forward pass in het netwerk terecht, waardoor het attention- en feed-forward-werk neerkomt op een klein aantal grote matrixvermenigvuldigingen die duizenden tokens tegelijk beslaan. Eén keer uitlezen van de modelgewichten uit het geheugen volstaat voor de gehele prompt. De matrix-units van de accelerator blijven bezet, wat betekent dat prefill compute-bound is: de limiet wordt bepaald door de snelheid waarmee de chip kan vermenigvuldigen.
Decoding kan niet op die manier werken, omdat token 2 afhankelijk is van token 1. Het token dat het model zojuist heeft geproduceerd, wordt onderdeel van de input voor de volgende stap, waardoor de stappen niet tegelijkertijd kunnen worden uitgevoerd. Elk output-token krijgt zijn eigen forward pass, en elk van die passes leest de volledige set modelgewichten uit het high-bandwidth memory om één enkel token te produceren. Dat maakt decoding memory-bound: de limiet is de snelheid waarmee gewichten kunnen worden verplaatst, niet de snelheid waarmee ze kunnen worden vermenigvuldigd. Hetzelfde verkeer aan gewichten dat tijdens prefill een hele prompt verwerkte, levert u tijdens decoding slechts één token op.
Serving-systemen gaan dit tegen door middel van batching. Veel verzoeken worden tegelijk gedecodeerd, waardoor één keer uitlezen van de gewichten één token oplevert voor elk verzoek in de batch. Dat is de reden waarom decoding überhaupt betaalbaar is. De beperkende factor is opnieuw het geheugen. Elk actief verzoek houdt een KV cache bij (key/value cache, de opgeslagen attention-status voor elk token tot nu toe); die cache groeit met elk gegenereerd token, en wanneer deze de accelerator vult, kan de batch niet verder groeien.
Niets hiervan geeft u een exact getal, en u moet 5x niet zien als een gemeten hardwareverhouding. Het is een prijs, vastgesteld door Anthropic, gebaseerd op die asymmetrie. Wat u zelf kunt controleren is de richting, en dat kost ongeveer een minuut.
Meet zelf het verschil tussen input en output
Installeer de tools op een willekeurige Ubuntu-machine:
sudo apt update && sudo apt install -y curl jq moreutilsStuur nu een korte prompt die om een lang antwoord vraagt en voorzie elke regel van een tijdstempel zodra deze binnenkomt.
curl -sN https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{"model":"claude-sonnet-5","max_tokens":1000,"stream":true,
"messages":[{"role":"user","content":"Count from 1 to 300, one number per line."}]}' \
| ts -s '%.s'ts -s plaatst voor elke regel het aantal seconden dat is verstreken sinds de start van het commando. Twee zaken zijn uit deze output af te lezen. De eerste content_block_delta regel is uw tijd tot het eerste token (time to first token), waarbij de volledige prefill binnen dit tijdsbestek plaatsvond. Elke regel daarna is een kleine stap in het decoderingsproces en de tijdstempels blijven oplopen tot message_stop verschijnt.
Draai de verhouding nu om. Plaats een lang document in de prompt en beperk het antwoord tot enkele tokens.
curl -sN https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d "$(jq -n --rawfile doc ./long-document.txt \
'{model:"claude-sonnet-5", max_tokens:16, stream:true,
messages:[{role:"user", content:("Answer in one word. Is this document about networking?\n\n" + $doc)}]}')" \
| ts -s '%.s'De eerste delta duurt langer dan bij de korte prompt, omdat de prefill veel meer tekst moet verwerken. Zodra deze binnen is, is de respons vrijwel direct klaar, omdat er slechts enkele tokens gedecodeerd hoeven te worden. Tienduizenden tokens gingen erin en de klok liep nauwelijks op. Enkele honderden kwamen eruit en de klok liep gedurende het gehele proces.
Elke niet-streaming respons eindigt met de cijfers waarvoor u wordt gefactureerd.
{
"usage": {
"input_tokens": 41283,
"output_tokens": 6,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0
}
}Log alle vier de velden per verzoek. output_tokens bevat uitgebreid denkwerk; een model dat nadenkt voordat het antwoordt, factureert dit denkwerk tegen het outputtarief. Om de kosten van een prompt te berekenen voordat u deze verstuurt, accepteert POST /v1/messages/count_tokens hetzelfde verzoeklichaam, retourneert {"input_tokens": N} zonder het model uit te voeren en is kosteloos. Dit is niet het enige onderdeel van de API dat gratis is, en welke onderdelen van de Claude API nooit worden gefactureerd is het bekijken waard voordat u het budget voor een eerste project vaststelt.
Wat Claude per miljoen tokens in rekening brengt per augustus 2026
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5,
"output_multiple": 5
},
{
"label": "Sonnet 5 (to 31 Aug)",
"input_usd": 2,
"output_usd": 10,
"output_multiple": 5
},
{
"label": "Sonnet 5 (from 1 Sep)",
"input_usd": 3,
"output_usd": 15,
"output_multiple": 5
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25,
"output_multiple": 5
},
{
"label": "Fable 5",
"input_usd": 10,
"output_usd": 50,
"output_multiple": 5
}
]De laatste kolom is de output gedeeld door de input, en deze bevat 5 op elke rij. Haiku 4.5 factureert $1 voor input en $5 voor output. Opus 5 factureert $5 en $25. Fable 5, de duurste optie, factureert $10 en $50, en wat die Fable 5-tarieven u opleveren is het lezen waard voordat u die bovenste rij afschrijft. Wanneer u hoger in het assortiment kijkt, worden beide zijden met dezelfde factor vermenigvuldigd; dit verandert uw totaalbedrag, maar laat de verhouding tussen input en output ongewijzigd.
Sonnet 5 staat twee keer vermeld omdat het introductietarief verloopt. Tot en met 31 augustus 2026 factureert het $2 en $10. Vanaf 1 september 2026 geldt het standaardtarief van $3 en $15, wat 50% hoger is aan beide zijden. Elk uitgewerkt voorbeeld hieronder gebruikt het tarief van augustus.
Tarieven wijzigen en dit is niet de plek waar u deze moet controleren. claude.com/pricing is de enige bron van waarheid. Wat een prijswijziging overleeft, is de methode.
Eén kanttekening die de prijslijst niet toont: de documentatie van Anthropic stelt dat Claude 4.7 en latere modellen een nieuwere tokenizer gebruiken die ongeveer 30% meer tokens genereert voor dezelfde tekst dan de tokenizer in Sonnet 4.6 en eerder. Twee modellen vergelijken op basis van enkel de prijs per miljoen tokens zal het nieuwere model gunstiger doen lijken, omdat hetzelfde document bij dat model uit meer tokens bestaat. Vergelijk op basis van kosten per voltooide taak en test uw werkelijke prompts tegen het model dat u daadwerkelijk van plan bent te gebruiken. Dezelfde valkuil bestaat tussen aanbieders, wier tokenizers onderling meer verschillen dan dat; daarom vertelt het berekenen van een echte taak op zowel Claude als ChatGPT u meer dan het naast elkaar leggen van twee tariefkaarten. wat een miljoen Claude-tokens waard is in echte tekst behandelt hoe dat volume er in de praktijk uitziet.
Wanneer gaan outputkosten uw factuur domineren?
Omdat output 5 keer zo duur is als input, is het break-evenpunt eenvoudig te berekenen. Noem uw inputtokens I en uw outputtokens O. Input kost I. Output kost 5 keer O. Output beslaat de helft van uw uitgaven wanneer 5 keer O groter is dan I; dit komt overeen met een tokenverhouding van 5 input op 1 output.
Als uw prompt dus meer dan vijf keer zo lang is als uw antwoord, vormt input de grootste kostenpost. Daaronder is dat de output.
The data behind this chart
[
{
"label": "100:1",
"input_share_pct": 95.2,
"output_share_pct": 4.8
},
{
"label": "75:1",
"input_share_pct": 93.75,
"output_share_pct": 6.25
},
{
"label": "20:1",
"input_share_pct": 80,
"output_share_pct": 20
},
{
"label": "10:1",
"input_share_pct": 66.7,
"output_share_pct": 33.3
},
{
"label": "5:1",
"input_share_pct": 50,
"output_share_pct": 50
},
{
"label": "1:1",
"input_share_pct": 16.7,
"output_share_pct": 83.3
},
{
"label": "1:6",
"input_share_pct": 3.2,
"output_share_pct": 96.8
}
]Bij een verhouding van 100 op 1 is output 4.8% van de uitgaven en is het inkorten van de prompt de enige zinvolle optimalisatie. Bij 5 op 1 zijn beide zijden gelijk. Bij 1 op 6 is output 96.8% en is de prompt verwaarloosbaar. De meeste mensen schatten hun eigen verhouding verkeerd in; haal deze daarom uit uw logs voordat u begint met optimaliseren.
Een agent-workload: lange context in, kort antwoord uit
Neem één stap van een retrieval-agent: 60.000 input-tokens aan opgehaalde documenten en gesprekshistorie, en een antwoord van 800 tokens. Dat is een verhouding van 75 op 1, wat normaal is voor elk proces dat eerst leest voordat het schrijft.
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_cost": 0.06,
"output_cost": 0.004,
"total_cost": 0.064
},
{
"label": "Sonnet 5 (Aug)",
"input_cost": 0.12,
"output_cost": 0.008,
"total_cost": 0.128
},
{
"label": "Opus 5",
"input_cost": 0.3,
"output_cost": 0.02,
"total_cost": 0.32
},
{
"label": "Fable 5",
"input_cost": 0.6,
"output_cost": 0.04,
"total_cost": 0.64
}
]De output is 6.25% van die aanroep op elk model, omdat de verhouding vaststaat in de gehele prijslijst. De aanroep kost $0.32 op Opus 5, $0.128 op Sonnet 5 tegen het tarief van augustus, en $0.064 op Haiku 4.5. Tweehonderd van die stappen per dag op Opus 5 kost $64 per dag.
De hefboom is duidelijk zodra u de verdeling ziet. Het inkorten van het antwoord van 800 tokens naar 400 bespaart ongeveer 3% van de aanroep. Het verwijderen van 20.000 tokens aan verouderde context uit de prompt bespaart ongeveer een derde van de kosten. Het beperken van de outputlengte bij een leesintensieve agent is nagenoeg zinloze moeite. waar de tokens van een coding agent werkelijk naartoe gaan analyseert wat die prompt in de eerste plaats vult.
Een generatieworkload: korte prompt, lang concept
Draai de verhouding nu om. Een briefing van 2.000 tokens, een concept van 12.000 tokens; een verhouding van 1 op 6.
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_cost": 0.002,
"output_cost": 0.06,
"total_cost": 0.062,
"batch_total_cost": 0.031
},
{
"label": "Sonnet 5 (Aug)",
"input_cost": 0.004,
"output_cost": 0.12,
"total_cost": 0.124,
"batch_total_cost": 0.062
},
{
"label": "Opus 5",
"input_cost": 0.01,
"output_cost": 0.3,
"total_cost": 0.31,
"batch_total_cost": 0.155
},
{
"label": "Fable 5",
"input_cost": 0.02,
"output_cost": 0.6,
"total_cost": 0.62,
"batch_total_cost": 0.31
}
]De output beslaat 96.8% van deze rekening. Opus 5 kost $0.31 per concept, tegenover $0.062 voor Haiku 4.5. Dit prijsverschil van factor vijf komt vrijwel volledig voort uit de outputzijde; precies het punt waar een goedkoper model de meeste besparingen oplevert.
De laatste kolom toont dezelfde taak via de Batch API, die 50% korting biedt op zowel input als output. Opus 5 daalt naar $0.155 per concept. Batch levert resultaten binnen 24 uur in plaats van direct, waardoor het geschikt is voor het genereren van nachtelijke rapporten en bulkclassificatie. Het is niet geschikt voor taken waarbij een gebruiker direct op resultaat wacht.
Model-routing loont hier op een manier die bij de agent-stap niet het geval is. Als het uitgebreide deel van de taak mechanisch is, zoals het herformatteren van tekst of het uitwerken van een reeds goedgekeurde outline, produceert het goedkope model deze tokens tegen een vijfde van de prijs. kiezen tussen Opus, Sonnet en Haiku behandelt waar de kwaliteitsgrens in de praktijk ligt.
Caching verlaagt de kosten voor input, en alleen voor input
Prompt caching slaat een voorvoegsel van uw prompt op de server op en brengt een fractie van het inputtarief in rekening om dit opnieuw te lezen. Sinds augustus 2026 zijn de vermenigvuldigers 1,25x het basis-inputtarief voor het schrijven van een cache van 5 minuten, 2x voor het schrijven van een cache van 1 uur, en 0,1x voor het lezen van een hit.
Output valt niet onder deze regeling. Er is geen gecachte output. Elke token die het model schrijft, wordt elke keer tegen het volledige outputtarief gefactureerd, ongeacht hoeveel van de prompt als cache-hit terugkwam.
Neem dezelfde agent-stap op Opus 5, waarbij 55.000 van de 60.000 input-tokens uit een warme cache worden geleverd.
The data behind this chart
[
{
"label": "No cache",
"input_cost": 0.3,
"output_cost": 0.02,
"total_cost": 0.32
},
{
"label": "55k prefix cache read",
"input_cost": 0.0525,
"output_cost": 0.02,
"total_cost": 0.0725
}
]De kosten van de aanroep dalen van $0.32 naar $0.0725. De output-regel verandert niet: $0.02 daarvoor, $0.02 daarna. Caching verlaagt de rekening en verandert de opbouw ervan. Output was 6.25% van die aanroep. Het is nu meer dan een kwart daarvan, wat bepaalt aan welke knop het zinvol is om als volgende te draaien.
De eerste aanroep betaalt voor het schrijven. Een cache-schrijfactie van 5 minuten kost 1,25x de basis-input, dus deze verdient zichzelf na één hit terug. Een schrijfactie van 1 uur kost 2x, dus daarvoor zijn er twee nodig. de schrijf- en leesvermenigvuldigers, en waar caching niet langer loont werkt die berekening uit.
Vier knoppen waar u controle over heeft
- Stel
max_tokensin op uw p95-outputlengte, niet op het maximum van het model. - Routeer uitgebreide stappen naar een goedkoper model.
- Batch alles waar niemand op wacht.
- Verwijder de instructies die antwoorden onnodig lang maken.
max_tokens is een harde bovengrens. Deze hoog instellen kost op zichzelf niets, omdat u betaalt voor geproduceerde tokens en nooit voor de limiet zelf. Een ruime limiet voorkomt dat een antwoord voortijdig wordt afgebroken als er iets misgaat. Haal de output_tokens-verdeling uit uw logs, stel de limiet iets boven het 95e percentiel in en handel stop_reason: "max_tokens" af in uw code door het antwoord voort te zetten of opnieuw te proberen. Een afbreking die u detecteert kost minder dan een uitweiding van 4.000 tokens waarvoor u betaalt en die u vervolgens weggooit. Uitgebreid denkwerk komt ook in output_tokens terecht, dus baseer dat budget op dezelfde gegevens.
Routing werkt wanneer het dure deel van een stap het volume is in plaats van het oordeelsvermogen. Laat het krachtige model de beslissing nemen en laat het typewerk over aan een goedkoper model. Meet de gerouteerde versie eerst op uw eigen evaluatieset, want een goedkoop model dat twee pogingen nodig heeft, kost meer dan één dure poging.
Batching is de enige knop die korting geeft op output. 50% korting aan beide kanten, resultaten binnen 24 uur, en alles wat volgens een schema verloopt komt hiervoor in aanmerking.
De laatste knop is degene die mensen vaak overslaan. Zinsneden als "wees grondig" en "leg je redenering uit" bepalen de outputlengte van elke aanroep die u ooit zult doen. Vervang ze door de gewenste vorm: "Antwoord in maximaal drie zinnen" of "Retourneer alleen het JSON-object, zonder inleiding". Een systeemprompt die 300 tokens toevoegt aan elk antwoord kost vijf keer zoveel als diezelfde 300 tokens in de prompt. de kosten van een actieve agent onder controle houden behandelt de monitoringkant, en of de API of een vast abonnement goedkoper is voor uw patroon is het waard om te bepalen voordat u een week besteedt aan het optimaliseren van token-uitgaven die een abonnement had kunnen dekken. Voor één ontwikkelaar komt dat meestal neer op de vraag of Claude Pro's $20 per maand en de bijbehorende gebruikslimieten het werk dekken dat u anders per token zou afrekenen. Als u die limieten halverwege een sessie al bereikt, is uitzoeken op welk venster u wacht de eerste stap, omdat de oplossing daarna een kleiner model, een lichtere context, extra tegoeden of het verplaatsen van dat werk naar de API met verbruiksmeting is. Als de API met verbruiksmeting de goedkopere plek voor dat werk blijkt te zijn, laat overstappen naar een kleiner abonnement of opzeggen de maand die u al heeft betaald intact, dus de overstap kost u niets bij het vertrek. Als het abonnement dat u tegenover Pro afweegt dat van ChatGPT is in plaats van de API met verbruiksmeting, laat de twee abonnementsvormen naast elkaar geprijsd zien welke goedkoper uitvalt voor programmeerwerk. Als deze vraag voor een team wordt gesteld in plaats van voor één ontwikkelaar, houd er dan rekening mee dat Claude Enterprise een vergoeding per gebruiker combineert met tokens die tegen deze zelfde API-tarieven worden gemeten, dus elke knop op deze pagina is nog steeds van toepassing op het gemeten deel van die rekening.
FAQ
Waarom kosten output-tokens meer dan input-tokens?
Het genereren ervan vereist aanzienlijk meer tijd van de accelerator per token. Een prompt wordt in één forward pass over het geheel verwerkt, waardoor een enkele lezing van de modelgewichten duizenden tokens beslaat en de hardware wordt beperkt door de vermenigvuldigingscapaciteit. Een antwoord wordt token voor token geproduceerd, waarbij elk token een eigen forward pass nodig heeft die de volledige modelgewichten opnieuw inleest; de hardware wordt hierdoor beperkt door de geheugenbandbreedte. Anthropic hanteert voor output een prijs die vijf keer zo hoog is als voor input over de gehele huidige catalogus, van Haiku 4.5 tot Fable 5.
Maakt prompt caching output-tokens goedkoper?
Nee. Prompt caching is alleen van toepassing op input. Sinds augustus 2026 kost een cache-read 0.1x het basistarief voor input, en cache-writes kosten 1.25x voor de duur van 5 minuten of 2x voor de duur van 1 uur. Output wordt bij elke aanroep tegen het volledige tarief gefactureerd, ongeacht wat de cache heeft gedaan. Daarom verandert caching zowel de verhouding als de omvang van uw factuur: zodra de input-kant wegvalt, wordt de output het deel waar de kosten zich concentreren.
Kost een hoge max_tokens mij geld als het antwoord kort is?
Nee. U wordt gefactureerd voor de tokens die het model daadwerkelijk produceert, dus max_tokens is een maximum en geen reservering. Het blijft echter van belang, omdat het de enige harde limiet is voor een antwoord dat uit de hand loopt. Stel deze iets boven het 95e percentiel van uw geobserveerde output_tokens in en handel stop_reason: "max_tokens" vervolgens af in de code in plaats van een stilletjes afgebroken antwoord te versturen.
Hoe bepaal ik mijn eigen verhouding tussen input- en output-tokens?
Log input_tokens, output_tokens, cache_read_input_tokens en cache_creation_input_tokens uit het usage-object van elke respons en deel de totalen over een week. Bij een verhouding van meer dan 5 input-tokens op 1 output-token zit uw geld in de prompt; cache daarom het stabiele deel en kort de rest in. Daaronder zit uw geld in het antwoord; beperk daarom de lengte ervan en verplaats de stappen die de meeste output genereren naar een goedkoper model of naar de Batch API.