Welk Claude model kiezen? Kostenvergelijking
Vergelijk de tarieven van Claude Opus 4.8, Sonnet 5 en Haiku 4.5. Bekijk de exacte kosten per 100.000 jobs en de impact van de instellingen op uw API-factuur.
Welk Claude-model moet ik gebruiken?
Het korte antwoord op de vraag welk Claude-model u moet gebruiken: begin met Claude Opus 4.8. Gebruik een ander model alleen als u daar een specifieke reden voor heeft. De richtlijnen van Anthropic zijn hetzelfde. "Als u niet zeker weet welk model u moet gebruiken, begin dan met Claude Opus 4.8 voor complexe agentic coding en enterprise werk." Stap over naar Claude Sonnet 5 wanneer de taak duidelijk gespecificeerd is en u deze meerdere keren per dag uitvoert. Stap opnieuw over naar Claude Haiku 4.5 voor mechanisch, high-volume werk waarbij u al weet hoe een correct antwoord eruitziet. Claude Fable 5 staat boven al deze modellen voor langlopende agents.
Deze keuze brengt kosten met zich mee. Dit zijn de tarieven voor de Claude API (application programming interface) per 23 juli 2026, per miljoen tokens (in de documentatie aangeduid als MTok).
- Claude Fable 5 (
claude-fable-5): $10 / MTok in, $50 / MTok out. 1M context. - Claude Opus 4.8 (
claude-opus-4-8): $5 in, $25 out. 1M context. - Claude Opus 4.7 (
claude-opus-4-7): $5 in, $25 out. 1M context. - Claude Sonnet 5 (
claude-sonnet-5): $2 in, $10 out via introductieprijs tot 31 augustus 2026. Het standaardtarief van $3 in, $15 out geldt vanaf 1 september 2026. 1M context. - Claude Haiku 4.5 (
claude-haiku-4-5): $1 in, $5 out. 200K context.
Deze identifiers zijn volledig zoals ze er staan. Er wordt niets aan toegevoegd.
De omvang zelf brengt geen extra kosten met zich mee voor de 1M-token modellen: "Een verzoek van 900k-tokens wordt gefactureerd tegen hetzelfde tarief per token als een verzoek van 9k-tokens."
Waar elk model daadwerkelijk voor dient
Anthropic beschrijft de reeks met één regel per model. Deze beschrijvingen zijn betrouwbaarder dan elk leaderboard.
- Claude Fable 5: "Next-generation intelligence for long-running agents." Dit model heeft de hoogste latency van de vier.
- Claude Opus 4.8: "For complex agentic coding and enterprise work." Gemiddelde latency.
- Claude Sonnet 5: "The best combination of speed and intelligence." Snel.
- Claude Haiku 4.5: "The fastest model with near-frontier intelligence."
Haiku 4.5 heeft beperkingen die de geschiktheid voor een taak bepalen voordat de prijs een rol speelt. Het context window is 200K tokens in plaats van 1M. Een groot repository of een lang agent-transcript past hierdoor niet in. De maximale output op de synchronous Messages API is 64K tokens, terwijl dit bij de andere modellen 128K tokens is. De kenniscutoff ligt bij februari 2025, terwijl de andere drie modellen een cutoff hebben van januari 2026.
Wat kost de keuze mij bij een echte workload?
Elk model in de reeks brengt output in rekening tegen een tarief van vijf keer het inputtarief. Opus 4.8 kost $5 voor input en $25 voor output. Haiku 4.5 kost $1 voor input en $5 voor output. Deze verhouding blijft gelijk over het gehele bereik. De keuze voor een model is daarom het meest relevant bij taken die veel output genereren.
Agentic work valt onder dit type taken. Dit komt omdat thinking tokens worden gefactureerd als output tokens en meetellen voor max_tokens, zelfs als de tekst u nooit bereikt. Op Fable 5, Opus 4.8, Opus 4.7 en Sonnet 5 wordt de reasoning summary standaard weggelaten, waardoor het thinking veld leeg blijft. De facturatie verandert niet: "In beide gevallen wordt het blok op dezelfde manier gefactureerd en op dezelfde manier teruggestuurd in multi-turn gesprekken." Wat een Claude token-rekening daadwerkelijk vult legt dit proces volledig uit.
Of thinking überhaupt wordt uitgevoerd, verschilt per model. Dit kan een kostenanalyse verstoren als u dit over het hoofd ziet. Op Sonnet 5 en Fable 5 staat thinking standaard aan en is er geen configuratie nodig. Op Opus 4.8 en Opus 4.7 staat het uit, tenzij u thinking: {type: "adaptive"} instelt in de request. Zorg dat de configuratie aan beide kanten gelijk is voordat u de cijfers analyseert.
Waarom het goedkoopste model de duurste kan zijn
Neem een afzonderlijke programmeertaak. De aanvraag bevat 60,000 tokens aan context en het model genereert 8,000 tokens aan output inclusief thinking. Zonder caching blijft de berekening zichtbaar.
Op Opus 4.8: 0.06 MTok aan input tegen $5 is $0.30, en 0.008 MTok aan output tegen $25 is $0.20. De poging kost $0.50. Op Haiku 4.5 kost dezelfde poging $0.06 plus $0.04, dus $0.10.
Haiku is vijf keer goedkoper per poging. Dit lijkt een grote besparing, totdat u ziet wat een mislukte poging veroorzaakt. U leest een foutief antwoord, wat tijd kost. U stuurt dit antwoord opnieuw als context bij de volgende poging, waardoor elke poging groter is dan de vorige. Wanneer de derde poging nog steeds faalt, schakelt u alsnog over naar een groter model: $0.30 aan Haiku plus $0.50 aan Opus is $0.80, wat 60% meer is dan één keer Opus gebruiken.
De beslissende vraag is hoe goedkoop u het antwoord kunt controleren. Wanneer een foutief antwoord binnen één seconde duidelijk is, is het kleine model een koopje. Wanneer het herkennen van een fout zorgvuldig lezen van een diff vereist, kost het kleine model u tijd die niet op de factuur staat.
Wanneer een kleiner model superieur is
Haiku 4.5 is de juiste keuze in de volgende gevallen:
- Mechanische subagent-taken. Een subagent die bestanden hernoemt of zoekresultaten verzamelt, heeft geen geavanceerde redenering nodig. Dit is het standaardpatroon zodra u een AI agent met Claude bouwt en helpers toevoegt.
- Log triage. Bepalen of een regel ruis is of menselijke aandacht vereist, is een beperkt oordeel met een duidelijk foutenprofiel.
- Classificatie tegen een vaste set labels. De output is kort en de nauwkeurigheid is meetbaar op een steekproef.
- Productie-aanroepen met een hoog volume. Bij 100,000 runs per dag is het verschil per token niet langer verwaarloosbaar. Dit is de gebruikelijke structuur van AI workflows gekoppeld aan n8n.
- Alles waarbij responssnelheid belangrijk is voor de gebruiker. Haiku 4.5 is het snelste model in de reeks.
Eén beperking geldt specifiek voor Haiku. De minimale prompt voor caching is 4,096 tokens, tegenover 1,024 bij Opus 4.8 en Sonnet 5. Onder die minimumwaarde geldt: "any requests to cache fewer than this number of tokens will be processed without caching, and no error is returned". Een instructieblok van 1,500 tokens dat bij Sonnet 5 stilletjes wordt gecached, wordt bij Haiku 4.5 niet gecached. Dit is herkenbaar aan cache_creation_input_tokens en cache_read_input_tokens die beide op nul staan, wat de kosten van een always-on agent verlaagt samen met andere redenen voor het mislukken van een cache.
De variabelen die het resultaat beïnvloeden
Elke actie hieronder heeft een grotere impact dan de modelnaam alleen.
Effort. output_config.effort bepaalt hoeveel werk het model verricht voordat het antwoord geeft. De niveaus zijn low, medium, high, xhigh en max. De standaardwaarde is high: "Het instellen van effort op high geeft exact hetzelfde gedrag als het volledig weglaten van de effort parameter." Deze instelling maakt deel uit van output_config in plaats van op het hoogste niveau van de request te staan:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)Effort heeft invloed op elk token in de respons: "Het kan alle token-kosten beïnvloeden, inclusief tool calls. Een lagere effort betekent bijvoorbeeld dat Claude minder tool calls uitvoert." Dit heeft een cumulatief effect in een agentic loop. Het is geen tokenlimiet: "Effort is een gedragssignaal, geen strikt tokenbudget." Anthropic publiceert geen kostenvermenigvuldiger per niveau. U moet uw eigen use case testen. Een Sonnet 5 run op high versus een Opus 4.8 run op low is een vergelijking die u vandaag nog kunt uitvoeren. Haiku 4.5 staat niet in de lijst met modellen die effort ondersteunen.
Prompt caching. Een cache read kost 0.1x het basis tarief van de input. De factor die de modelkeuze bepaalt, is de impact hiervan per tier. Een cache hit op Opus 4.8 kost $0.50 / MTok, terwijl uncached input op Haiku 4.5 $1 / MTok kost. Een goed gecachte Opus prefix is dus goedkoper per input token dan een koude Haiku prompt. Voor elke workload waarbij een grote stabiele prefix opnieuw wordt verzonden, is goede sessie-hygiëne belangrijker dan de modelkeuze.
Batches. Als een direct antwoord niet vereist is, biedt de Message Batches API dezelfde modellen aan met "50% korting op zowel input als output tokens". Dit halveert elke waarde in de onderstaande vergelijking. Dit geldt voor alle tiers: een gebatchte Opus 4.8 job is goedkoper dan een synchrone Sonnet 5 job tegen het standaardtarief vanaf 1 september 2026. Hierbij wordt latency geruild voor capaciteit tegen dezelfde kosten.
Kostenvergelijking per eenheid
De workload: classificeer 100.000 support-e-mails. Gebruik één aanroep per e-mail, met 2.000 input tokens en 300 output tokens per aanroep. Dit komt neer op 200 MTok input en 30 MTok output.
- Haiku 4.5: 200 x $1 = $200 in, 30 x $5 = $150 uit. Totaal $350.
- Sonnet 5, introductietarief: 200 x $2 = $400 in, 30 x $10 = $300 uit. Totaal $700.
- Sonnet 5, vanaf 1 september 2026: 200 x $3 = $600 in, 30 x $15 = $450 uit. Totaal $1.050.
- Opus 4.8: 200 x $5 = $1.000 in, 30 x $25 = $750 uit. Totaal $1.750.
Vervang vier getallen om de berekening met de prijzen van morgen te herhalen. De onderstaande aanpassingen hebben een grotere impact op het resultaat dan de modelnaam:
- Batching halveert elke regel: $175, $350, $525 en $875. Een nachtelijke classificatie-run heeft geen wachttijd, dus er is geen reden om deze over te slaan.
- Caching van de gedeelde prefix. Stel dat 1.200 van de 2.000 input tokens telkens dezelfde instructieblok zijn. Bij Sonnet 5 met het introductietarief kosten deze $0,20 / MTok als cache hits in plaats van $2 / MTok. 120 MTok kost dan $24 in plaats van $240. Tel 80 MTok nieuwe input toe tegen $2, wat $160 is, plus $300 aan output. De kosten voor Sonnet 5 komen dan uit op ongeveer $484 in plaats van $700. Dezelfde methode heeft geen effect op Haiku 4.5, omdat 1.200 tokens onder het minimum van 4.096 tokens ligt.
- Retries. Stel dat u het antwoord van Haiku bij 8% van de e-mails afwijst en deze opnieuw uitvoert op Opus 4.8. Tel 0,08 x $1.750 = $140 op bij de $350, wat $490 oplevert. Meet uw eigen afwijzingspercentage in plaats van dat u het mijne gebruikt.
- Tool definitions, indien de taak deze gebruikt. De gegenereerde system prompt is 290 tokens op Opus 4.8 met
tool_choiceingesteld opauto, 354 op Sonnet 5 en 496 op Haiku 4.5. Het goedkoopste model heeft de hoogste vaste overhead.
Haiku met een escalatiepad voor $490 en Sonnet 5 met caching voor $484 kosten evenveel, waarbij één van beide de taak in één enkele pass uitvoert. Het model was nooit de enige factor.
Bespaart het wisselen van modellen tijdens een sessie geld?
Minder vaak dan de catalogusprijzen suggereren. De besparing geldt namelijk per token, terwijl u een volledige gecachte prefix riskeert.
Anthropic documenteert wat een cache ongeldig maakt. Prefixes worden opgebouwd in de volgorde tools, dan system, en dan messages. "Wijzigingen op elk niveau maken dat niveau en alle volgende niveaus ongeldig." Twee instellingen voor verzoeken staan ook op deze lijst: "De thinking configuration en het opgeloste effort niveau worden in de prompt zelf verwerkt, dus het wijzigen van een van deze instellingen start een nieuwe cache prefix." In de documentatie wordt dit verder toegelicht: "Varieer de effort tussen verschillende workloads in plaats van binnen één gesprek dat afhankelijk is van cache hits".
Het model staat niet op deze gedocumenteerde lijst, dus ga er in geen geval vanuit dat dit het geval is. Controleer cache_read_input_tokens bij de eerste aanvraag na een wissel; het getal geeft u het antwoord. Bij een Opus 4.8 prefix van 150,000 tokens kost een cache read ongeveer $0.08 en een nieuwe write ongeveer $0.94. Dit is meer dan het verschil in prijs per token van meerdere beurten waar u naar op zoek was.
Wijzig deze instellingen dus tussen taken door, niet binnen één taak. In Claude Code betekent dit: eerst /clear, wanneer de cache toch wordt verwijderd, en daarna /model of /effort.
Hoe u het antwoord kunt testen op uw eigen workload
Bepaal de omvang van een prompt niet op basis van een telling van een ander model. De token-counting endpoint is gratis te gebruiken en telt met de tokenizer van het door u opgegeven model. Geef daarom het model op dat u van plan bent aan te roepen. Opus 4.7 en later, Fable 5 en Sonnet 5 gebruiken een nieuwere tokenizer die "ongeveer 30% meer tokens produceert voor dezelfde tekst". Een budget dat is gemeten op een ouder model is daarom te laag voor een nieuwere versie bij een gelijkblijvend tarief per token.
Lees vervolgens het resultaat. input_tokens bevat alleen het niet-gecachete restant, dus de werkelijke prompt-omvang is dat veld plus cache_creation_input_tokens plus cache_read_input_tokens. Een eerste Claude API app op een VPS is de meest betrouwbare plek om die meting uit te voeren, en welk Claude plan bij uw gebruik past is een aparte beslissing over de vraag of u überhaupt per token betaalt.
FAQ
Welk Claude-model is het beste voor coderen?
Claude Opus 4.8 is het gedocumenteerde startpunt voor complexe agentic coding, tegen een prijs van $5 per miljoen input tokens en $25 per miljoen output per juli 2026. Claude Sonnet 5 is de beste combinatie van snelheid en intelligentie. Met een prijs van $2 / $10 tot 31 augustus 2026 kost dit minder dan de helft. Voer dezelfde taak uit op beide modellen, houd de thinking-configuratie constant, en vergelijk de totale token-uitgaven vanaf response.usage.
Is Claude Haiku 4.5 goedkoop genoeg om Sonnet 5 te vervangen?
Per token is dat eenvoudig: $1 / $5 tegenover $2 / $10 voor Sonnet 5 bij de introductieprijs, of $3 / $15 vanaf 1 september 2026. De limieten zijn doorslaggevend. Haiku 4.5 heeft een context window van 200K tokens in plaats van 1M, een maximale output van 64K op de synchrone Messages API, een betrouwbare knowledge cutoff van februari 2025, geen output_config.effort ondersteuning, en een minimale cachebare prompt van 4,096 tokens die caching op korte system prompts uitschakelt.
Bespaart het wisselen naar een goedkoper Claude-model halverwege een sessie geld?
Minder vaak dan het lijkt. Anthropic documenteert cache-invalidators als wijzigingen aan de tools, system of messages prefix, wijzigingen aan de thinking-configuratie, en wijzigingen aan output_config.effort. Wat een modelwissel doet met een bestaande cache is niet gedocumenteerd; beschouw dit als onbekend en lees cache_read_input_tokens bij de eerste verzoek daarna. De impact is groot: bij een Opus 4.8 prefix van 150,000 tokens kost een cache-read ongeveer $0.08 en een nieuwe write ongeveer $0.94. Dit is duurder dan de besparing per token over meerdere beurten. Wissel pas tussen taken na /clear in Claude Code, wanneer de cache toch wordt verwijderd.
Wat is het effect van output_config.effort op de factuur?
Het verandert het aantal tokens dat het model verbruikt aan tekst, tool calls en thinking. Een lagere effort leidt tot minder tool calls. Dit heeft een cumulatief effect op agentic loops omdat elk tool-resultaat in latere beurten opnieuw wordt verzonden. De niveaus zijn low, medium, high, xhigh en max, met high als standaard. Anthropic publiceert geen kostenmultiplier per niveau. Effort wordt beschreven als een gedragssignaal in plaats van een tokenbudget, dus meet dit zelf op basis van uw taak.
Hoeveel bespaart de Claude Batches API?
50% op zowel input- als outputtokens, in ruil voor asynchrone levering. Per juli 2026 betekent dit voor Opus 4.8 een prijs van $2.50 in / $12.50 uit, voor Sonnet 5 $1 / $5 bij de introductieprijs, en voor Haiku 4.5 $0.50 / $2.50. De vergelijking tussen tiers is relevant: een batched Opus 4.8-taak kost minder dan een synchrone Sonnet 5-taak tegen het standaardtarief vanaf 1 september 2026. Batching biedt dus een krachtiger model voor hetzelfde geld.