SSD Nodes Learn 🎉 VPS vanaf $4.99/mnd
Gidsen Matt ConnorDoor Matt Connor · Bijgewerkt 2026-08-07

Wat kost 1 miljoen tokens in de Claude API?

De prijs voor 1 miljoen tokens bij Claude verschilt per model en hangt af van de verhouding tussen input en output. Bereken hier uw maandelijkse kosten voor de API-toegang.

Hoeveel kost 1M tokens in Claude?

1M tokens staat voor één miljoen tokens; dit is de eenheid waarin elke Claude API (application programming interface) prijs wordt uitgedrukt. Er is geen vaste prijs voor, omdat input en output tegen verschillende tarieven worden gefactureerd en elk model zijn eigen tarieven hanteert. Per augustus 2026 kost één miljoen input-tokens $1 bij Claude Haiku 4.5, $2 bij Claude Sonnet 5 en $5 bij Claude Opus 5.

Output is het duurdere deel. Bij elk huidig model is het output-tarief vijf keer zo hoog als het input-tarief, waardoor de verhouding tussen beide meer invloed heeft op uw factuur dan het genoemde basisbedrag. Een applicatie die lange documenten verstuurt en korte antwoorden terugkrijgt, gedraagt zich heel anders dan een applicatie die lange antwoorden schrijft op basis van een korte prompt.

Deze pagina behandelt de eenheidseconomie: wat een token kost en hoe u een factuur inschat voordat u begint met bouwen. Voor informatie over waar de tokens daadwerkelijk blijven tijdens het werken, leest u waar de tokens blijven tijdens een Claude Code sessie.

Hoe 1M tokens eruitzien

Een token is een tekstfragment dat het model leest of schrijft. De algemene richtlijn van Anthropic is één token per 4 tekens, of ongeveer 0,75 Engelse woorden. Eén miljoen tokens staat daarom gelijk aan ongeveer 750.000 woorden, of ruwweg 4 MB aan platte tekst.

Gepubliceerde schattingen voor veelvoorkomende invoer geven een beter beeld van de schaal.

ChartApproximate input token counts for common content, published estimates
The data behind this chart
[
  {
    "label": "Average web page (10 kB)",
    "tokens": "2,500"
  },
  {
    "label": "Documentation page (100 kB)",
    "tokens": "25,000"
  },
  {
    "label": "Research paper PDF (500 kB)",
    "tokens": "125,000"
  }
]

Bij die verhoudingen staat 1M tokens gelijk aan ongeveer 400 gemiddelde webpagina's die één keer worden gelezen, of acht wetenschappelijke artikelen van die omvang. Het is één volledige doorloop van een middelgrote codebase, of een maand aan licht chatgebruik door één persoon.

Beschouw dit alles als een schatting. Code, JSON en tekst in andere talen dan het Engels bevatten minder woorden per token, waardoor de verhouding van 0,75 aan de optimistische kant is. Er is nog een factor die het aantal beïnvloedt: Claude Opus 4.7 en later, inclusief Opus 5 en Sonnet 5, gebruiken een nieuwere tokenizer die ongeveer 30 procent meer tokens genereert voor dezelfde tekst dan Sonnet 4.6 en eerder. Claude Haiku 4.5 gebruikt de oudere tokenizer. Een telling die u heeft gemeten op Haiku 4.5 is dus een onderschatting van het aantal voor Sonnet 5 bij identieke invoer; een directe vergelijking van de prijs per miljoen over die grens heen is daarom niet representatief. Tel dezelfde prompt voor beide modellen voordat u een besluit neemt.

Wat Claude per miljoen tokens in rekening brengt

ChartClaude API list price in USD per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5
  },
  {
    "label": "Sonnet 5 (to 31 Aug 2026)",
    "input_usd": 2,
    "output_usd": 10
  },
  {
    "label": "Sonnet 5 (from 1 Sep 2026)",
    "input_usd": 3,
    "output_usd": 15
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25
  }
]

Claude Sonnet 5 hanteert tot 31 augustus 2026 een introductietarief van $2 voor input en $10 voor output. Vanaf 1 september 2026 geldt het standaardtarief: $3 voor input en $15 voor output. Claude Opus 5 kost $5 voor input en $25 voor output.

Tarieven wijzigen. Beschouw elk cijfer op deze pagina als een rekenvoorbeeld van augustus 2026 en controleer de actuele bedragen op de officiële prijspagina voordat u een budget goedkeurt.

De contextlengte heeft geen invloed op het tarief. Bij Claude 4.6 en latere versies wordt het volledige contextvenster van 1M tokens tegen het standaardtarief gefactureerd. Een verzoek van 900.000 tokens kost per token dus hetzelfde als een verzoek van 9.000 tokens. Een lange prompt kost meer omdat deze uit meer tokens bestaat; er is geen afzonderlijk tarief voor een lange context.

De berekening die een prijswijziging overleeft

Elke factuur bestaat uit twee vermenigvuldigingen en één optelling.

cost = (input_tokens  / 1,000,000) * input_rate
     + (output_tokens / 1,000,000) * output_rate

Geschreven als code die u kunt uitvoeren:

INPUT_RATE = 2.00    # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00  # USD per million output tokens

def cost(input_tokens, output_tokens):
    return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000

print(f"{cost(4300, 400):.4f}")

Dit print 0.0126. Een verzoek dat 4,300 input tokens verstuurt en 400 output tokens terugkrijgt, kost ongeveer 1.3 cent op Sonnet 5. Houd de twee tarieven op één plek in uw code. Wanneer een prijs verandert, past u twee regels aan en elke schatting in uw systeem wordt automatisch bijgewerkt.

Een uitgewerkte schatting voor een echte applicatie

Neem een ondersteuningsassistent. De systeemprompt en de productdocumentatie beslaan 4.000 tokens. Deze worden bij elk verzoek meegestuurd, omdat de Messages API stateless is en het model niets onthoudt tussen aanroepen door. Een gebruikersvraag voegt ongeveer 300 tokens toe. Een antwoord bevat ongeveer 400 tokens. Dat is 4.300 input-tokens en 400 output-tokens per verzoek.

Eén miljoen input-tokens staat gelijk aan ongeveer 232 verzoeken van dit formaat. Bij 1.000 verzoeken per dag verbruikt de applicatie dagelijks 4,3 miljoen input-tokens; "1M tokens" is dus minder dan zes uur aan verkeer.

ChartEstimated cost per 1,000 requests at 4,300 input and 400 output tokens
The data behind this chart
[
  {
    "label": "Opus 5, list rates",
    "cost_per_1k_usd": "31.50"
  },
  {
    "label": "Sonnet 5, list rates",
    "cost_per_1k_usd": "12.60"
  },
  {
    "label": "Sonnet 5, Batch API",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Haiku 4.5, list rates",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Sonnet 5, warm prompt cache",
    "cost_per_1k_usd": "5.40"
  }
]

Bij Claude Opus 5 kost dat verkeer $31.50 per 1.000 verzoeken. Bij Sonnet 5 is dit $12.60. Overstappen naar Claude Haiku 4.5 brengt de kosten op $6.30, en een actieve prompt cache op Sonnet 5 verlaagt dit verder naar $5.40.

Vermenigvuldig dit met 30 voor een maand aan dergelijk verkeer. Sonnet 5 kost tegen de standaardtarieven ongeveer $378 per maand. Dezelfde applicatie met een actieve cache kost ongeveer $162. Uw modelkeuze en uw beslissing over caching zijn elk belangrijker dan welk tarief u ook zult onderhandelen bij dit volume. Welk model u moet gebruiken is een vraag op zich, en het goedkoopste model dat slaagt voor uw evaluaties wint: keuze tussen Opus, Sonnet en Haiku behandelt hoe u dit correct test.

Prompt caching verlaagt de kosten voor herhaalde onderdelen

Die prefix van 4.000 tokens is bij elk verzoek identiek, en u betaalt telkens de volledige inputprijs. Prompt caching slaat de verwerkte prefix op en brengt een gereduceerd tarief in rekening voor hergebruik.

Een cache-read kost 0,1 keer het standaard inputtarief. Het schrijven naar de cache kost 1,25 keer het basistarief voor een levensduur van 5 minuten, of 2 keer het basistarief voor een levensduur van 1 uur. De cache van 5 minuten verdient zichzelf dus na één read terug, omdat de write 0,25 extra kost terwijl elke read 0,9 bespaart. De cache van 1 uur heeft twee reads nodig om quitte te spelen.

De eenvoudigste manier om dit in te schakelen is via een enkel veld op het hoogste niveau:

curl https://api.anthropic.com/v1/messages \
  -H "content-type: application/json" \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "You are a helpful assistant.",
    "messages": [
      {"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
    ]
  }'

Lees vervolgens het usage-blok dat wordt geretourneerd:

{
  "usage": {
    "cache_creation_input_tokens": 5120,
    "cache_read_input_tokens": 1800,
    "input_tokens": 50,
    "output_tokens": 503
  }
}

Die drie inputtellers worden tegen drie verschillende tarieven gefactureerd en vormen samen uw werkelijke inputvolume: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens. Een kostenraming die alleen input_tokens leest, zal ernstig afwijken zodra caching is ingeschakeld.

Twee factoren zorgen ervoor dat een cache niet rendabel is, en beide falen zonder foutmelding.

De prefix moet byte-identiek zijn. Cache-lookup is een prefix-match, dus een tijdstempel of de naam van de gebruiker bovenaan uw system prompt wijzigt deze bij elk verzoek. U betaalt dan telkens 1,25 keer het basisinputtarief en leest nooit uit de cache. Het symptoom is dat cache_creation_input_tokens hoog blijft terwijl cache_read_input_tokens op 0 blijft staan. Plaats cache_control op het laatste blok waarvan de inhoud over verzoeken heen gelijk blijft, en zet alles wat varieert daarna. Het wijzigen van uw tools-definities maakt de volledige cache daaronder ongeldig, omdat invalidatie de volgorde tools, dan system, dan messages volgt.

De prefix moet lang genoeg zijn. De minimale cachebare lengte is 512 tokens op Opus 5, 1.024 op Sonnet 5 en 4.096 op Haiku 4.5. Een kortere prompt wordt niet gecachet en er wordt geen foutmelding geretourneerd. De prefix van 4.000 tokens in het bovenstaande voorbeeld wordt gecachet op Sonnet 5, maar niet op Haiku 4.5, omdat 4.000 onder de ondergrens van dat model ligt. Wanneer beide tellers op 0 staan, is er niets gecachet.

Batchverwerking halveert het tarief

De Batch API verwerkt verzoeken asynchroon tegen 50 procent korting op zowel input als output. In het bovenstaande voorbeeld verandert dat $12.60 per 1.000 verzoeken in $6.30. De korting is cumulatief met prompt caching, waardoor een gecachte batch-taak de goedkoopste manier is om bulkwerk uit te voeren.

Wat u inlevert is latency, waardoor batchverwerking ongeschikt is voor processen waarbij een gebruiker moet wachten op resultaat. Het is geschikt voor classificatie 's nachts en het verwerken van achterstanden in documentatie.

Waarom chatkosten toenemen binnen één gesprek

Omdat de API geen status bijhoudt, verstuurt uw client bij elke interactie het volledige gesprek opnieuw. Het tokenverbruik binnen één chat groeit daarom kwadratisch met de lengte ervan, en niet lineair.

Neem interacties met een gemiddelde van 500 tokens. Interactie 1 verstuurt 500 input-tokens. Interactie 2 verstuurt 1.000. Interactie 20 verstuurt 10.000. Als u dit optelt met de formule n(n+1)/2, dan heeft een gesprek van 20 interacties in totaal ongeveer 105.000 input-tokens verstuurd, terwijl het transcript zelf slechts 10.000 tokens lang is.

Dit is de reden waarom een chatfunctie meer kost dan het transcript doet vermoeden, en waarom het cachen van het stabiele voorvoegsel of het samenvatten van oudere interacties zichzelf terugbetaalt bij lange threads. Een agent die lussen uitvoert over tool-aanroepen vertoont hetzelfde patroon, maar dan erger: elk resultaat van een tool blijft in de geschiedenis staan en wordt bij elke volgende interactie opnieuw verstuurd. Het instellen van een strikte bestedingslimiet voor een agent die u zelf draait is hierbij van cruciaal belang, omdat deze groei automatisch verloopt en vaak onopgemerkt blijft.

Tel de tokens voordat u een schatting maakt

Stop met het afleiden van aantallen tokens op basis van het aantal woorden. De API telt deze voor u, zonder extra kosten, via een rate limit die losstaat van het aanmaken van berichten.

curl https://api.anthropic.com/v1/messages/count_tokens \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "content-type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "system": "You are a scientist",
    "messages": [{
      "role": "user",
      "content": "Hello, Claude"
    }]
  }'

Het antwoord bevat één veld:

{ "input_tokens": 14 }

Voer uw werkelijke systeemprompt en tooldefinities in, samen met een representatief gebruikersbericht, en plaats het getal vervolgens in de bovenstaande kostenfunctie. Het eindpunt accepteert dezelfde body als een berichtverzoek, waardoor ook afbeeldingen en PDF's correct worden meegeteld. Twee kanttekeningen zijn van belang. De telling is een schatting en kan licht afwijken van het gefactureerde cijfer. Daarnaast wordt de meting uitgevoerd met de tokenizer van het model dat u doorgeeft; gebruik dus het model dat u daadwerkelijk gaat draaien.

Output-tokens kunnen niet vooraf worden geteld, omdat deze nog niet bestaan. Begrens deze met max_tokens en meet vervolgens de werkelijke verdeling op basis van usage.output_tokens bij live verkeer.

Wat staat er nog meer op de factuur

Tokens vormen het grootste deel van de factuur. Een paar posten zijn geen tokens, en deze verrassen gebruikers vaak.

  • Tooldefinities worden bij elk verzoek als input-tokens meegeteld. Alleen al het systeem-prompt voor toolgebruik voegt 286 tot 406 tokens toe op Opus 5, nog voordat uw eigen schema's worden meegerekend. Tien uitgebreide toolbeschrijvingen kunnen een klein prompt verdubbelen.
  • Zoekopdrachten op het web worden gefactureerd tegen $10 per 1.000 zoekopdrachten, bovenop de tokens die de resultaten verbruiken wanneer ze in de context worden geladen.
  • Het ophalen van webpagina's (web fetch) brengt geen eigen kosten met zich mee, maar de opgehaalde pagina wordt wel omgezet in input-tokens. Een documentatiepagina van 100 kB staat ongeveer gelijk aan 25,000 tokens.
  • Het verzoeken om inferentie die uitsluitend in de VS plaatsvindt met inference_geo op Claude 4.6 en later, past een vermenigvuldiger van 1,1 toe op elke tokencategorie, inclusief cache-reads en -writes.

Of de API de juiste keuze is, hangt af van uw volume. Onder een bepaald gebruiksniveau is een vast maandelijks abonnement voordeliger, en de API vergeleken met een Claude-abonnement voert die vergelijking uit met concrete cijfers.

FAQ

Hoeveel kost 1M tokens in Claude?

Dit hangt af van het model en of het om input- of output-tokens gaat. Per augustus 2026 kost één miljoen input-tokens $1 bij Claude Haiku 4.5, $2 bij Claude Sonnet 5 onder introductietarieven, en $5 bij Claude Opus 5. Output kost bij elk van deze modellen vijf keer het inputtarief. Sonnet 5 gaat per 1 september 2026 over naar $3 voor input en $15 voor output. Tarieven wijzigen, dus controleer deze op de officiële prijspagina voordat u een bedrag in een budget opneemt.

Is 1M tokens hetzelfde als 1M woorden?

Nee. Eén token staat ongeveer gelijk aan 4 tekens in het Engels, of ongeveer 0,75 woorden; één miljoen tokens is dus ongeveer 750.000 woorden. Deze verhouding is slechts een richtlijn. Code, JSON en andere talen dan het Engels gebruiken meer tokens per woord. Claude Opus 4.7 en later gebruiken bovendien een nieuwere tokenizer die voor identieke tekst ongeveer 30 procent meer tokens genereert dan Claude Sonnet 4.6 en eerder; aantallen zijn dus niet uitwisselbaar tussen modelgeneraties. Meet met het gratis /v1/messages/count_tokens-eindpunt door het model door te geven dat u van plan bent te gebruiken.

Bespaart prompt caching altijd geld?

Nee. Een cache-write van 5 minuten kost 1,25 keer het basistarief voor input; een prefix die wordt geschreven maar nooit wordt gelezen, kost dus 25 procent meer dan deze simpelweg meesturen. Het verdient zichzelf terug vanaf de eerste keer lezen. Het faalt op twee manieren, beide geruisloos. Als de gecachte prefix wijzigt tussen verzoeken, vindt er nooit een match plaats, omdat het een exacte prefix-match betreft. Als de prefix korter is dan de minimale cachebare lengte van het model (1.024 tokens bij Sonnet 5 en 4.096 bij Haiku 4.5), wordt er niets gecachet en wordt er geen foutmelding geretourneerd. Wanneer cache_creation_input_tokens en cache_read_input_tokens beide 0 lezen, doet de cache niets.

Waarom groeide mijn factuur sneller dan mijn aantal berichten?

Omdat het volledige gesprek bij elke beurt opnieuw wordt verzonden. De Messages API houdt geen status bij; beurt 20 van een chat bevat dus alle 19 eerdere beurten opnieuw als input. Bij beurten van gemiddeld 500 tokens verstuurt een gesprek van 20 beurten ongeveer 105.000 input-tokens, terwijl het transcript slechts 10.000 tokens lang is. Agent-loops gedragen zich op dezelfde manier, aangezien elk tool-resultaat in de geschiedenis blijft staan. Cache de stabiele prefix, of vat oudere beurten samen en verwijder deze uit het verzoek.

#claude#tokens#api-pricing#cost-estimation#prompt-caching