Welk Claude-model kiezen? Kostenoverzicht en advies
Twijfelt u tussen Claude Opus 4.8, Sonnet 5 of Haiku 4.5? Wij vergelijken de API-tarieven van juli 2026, berekenen de kosten per 100.000 taken en adviseren het juiste model.
Welk Claude-model moet ik gebruiken?
Het korte antwoord op de vraag welk Claude-model u moet gebruiken: begin met Claude Opus 4.8 en stap alleen over naar een ander model als u daar een specifieke reden voor heeft. Het advies van Anthropic is hetzelfde. "Als u niet zeker weet welk model u moet gebruiken, begin dan met Claude Opus 4.8 voor complexe agent-gebaseerde programmeertaken en zakelijk werk." Stap over naar Claude Sonnet 5 wanneer de taak goed gedefinieerd is en u deze vele malen per dag uitvoert. Stap verder omlaag naar Claude Haiku 4.5 voor mechanisch werk met een hoog volume, waarbij u al weet hoe een correct antwoord eruitziet. Claude Fable 5 staat boven al deze modellen voor langlopende agents.
Aan deze keuze is een prijskaartje verbonden. Dit zijn de tarieven voor de Claude API (application programming interface) per 23 juli 2026, per miljoen tokens, in de documentatie aangeduid als MTok.
- Claude Fable 5 (
claude-fable-5): $10 / MTok in, $50 / MTok uit. 1M context. - Claude Opus 4.8 (
claude-opus-4-8): $5 in, $25 uit. 1M context. - Claude Opus 4.7 (
claude-opus-4-7): $5 in, $25 uit. 1M context. - Claude Sonnet 5 (
claude-sonnet-5): $2 in, $10 uit tegen introductietarief tot en met 31 augustus 2026. Het standaardtarief van $3 in, $15 uit gaat in op 1 september 2026. 1M context. - Claude Haiku 4.5 (
claude-haiku-4-5): $1 in, $5 uit. 200K context.
Deze identificatiecodes zijn volledig zoals geschreven. Er wordt niets aan toegevoegd.
Op de 1M-tokenmodellen brengt de omvang zelf geen toeslag met zich mee: "Voor een aanvraag van 900k tokens geldt hetzelfde tarief per token als voor een aanvraag van 9k tokens." Deze tarieven gelden ook buiten de API, omdat Claude Enterprise het gebruik tegen API-tarieven registreert boven op de prijs per seat. Alles hieronder is dus dezelfde berekening voor een team met een seat-plan. Een abonnement met een vast tarief verandert wel de gebruiksmeter, maar niet deze beslissing, omdat beide Claude Max-niveaus dezelfde modellen bieden en alleen verschillen in de hoeveelheid gebruik die u krijgt. Verderop op dezelfde ladder koopt u met Claude Pro's $20 per maand een gebruiksquotum in plaats van een tarief per token, dus daar wordt u beperkt door het opnieuw instellen van de limiet en niet door een factuur. Als u zich daar nu bevindt, komt bepalen op welk venster u wacht vóór alle berekeningen hieronder. De oplossing is dan een kleiner model, een kleinere context of een overstap naar de API, en niet een lager tarief. Als u nog helemaal niet betaalt, wordt bepaald of Pro de $20 überhaupt waard is door hoe vaak de gratis limiet u tegenhoudt, en niet door een van de bovenstaande tarieven.
Waar elk model daadwerkelijk voor dient
Anthropic beschrijft de line-up met één regel per model, en die regels bieden meer houvast dan welke ranglijst dan ook.
- Claude Fable 5: "Intelligentie van de volgende generatie voor langlopende agents." Wordt beoordeeld als de traagste van de vier wat betreft latentie.
- Claude Opus 4.8: "Voor complexe agent-gebaseerde codering en zakelijk werk." Gemiddelde latentie.
- Claude Sonnet 5: "De beste combinatie van snelheid en intelligentie." Snel.
- Claude Haiku 4.5: "Het snelste model met intelligentie die de grens benadert."
Fable 5 is het enige model van de vier waarvoor deze vergelijking geen prijs per werklast hanteert, en met een tarief dat twee keer zo hoog ligt als dat van Opus 4.8, verdient de vraag welke taken $10 aan invoer en $50 aan uitvoer rechtvaardigen een eigen antwoord.
Haiku 4.5 heeft bovendien beperkingen die de geschiktheid voor een taak bepalen nog voordat de prijs dat doet. Het contextvenster is 200K tokens in plaats van 1M, waardoor een grote repository of een lang transcript van een agent niet past. De maximale uitvoer via de synchrone Messages API is 64K tokens tegenover 128K voor de andere modellen, en de betrouwbare kennisgrens ligt op februari 2025, terwijl de andere drie op januari 2026 zitten.
Wat kost deze keuze mij bij een reële werklast?
Elk model in de reeks berekent voor output een tarief dat vijf keer hoger ligt dan voor input. Opus 4.8 kost $5 per miljoen tokens input en $25 per miljoen tokens output. Haiku 4.5 kost $1 per miljoen tokens input en $5 per miljoen tokens output. Deze verhouding blijft over de gehele reeks gelijk, dus het gekozen model is vooral van belang bij taken die veel output genereren.
Agent-gebaseerd werk valt onder deze categorie, omdat 'thinking tokens' worden gefactureerd als output-tokens en meetellen voor max_tokens, zelfs wanneer de tekst u nooit bereikt. Bij Fable 5, Opus 4.8, Opus 4.7 en Sonnet 5 wordt de samenvatting van het denkproces standaard weggelaten, waardoor het veld thinking leeg terugkomt. De facturatie blijft ongewijzigd: "In beide gevallen wordt het blok op dezelfde wijze gefactureerd en op dezelfde wijze doorgegeven in gesprekken met meerdere beurten." Wat bepaalt werkelijk de Claude-tokenrekening ontleedt deze teller volledig.
Of het denkproces daadwerkelijk wordt uitgevoerd, verschilt per model dat u vergelijkt; dit kan een kostenvergelijking onbetrouwbaar maken als u hier geen rekening mee houdt. Bij Sonnet 5 en Fable 5 staat het denkproces standaard ingeschakeld en is geen configuratie vereist. Bij Opus 4.8 en Opus 4.7 is dit uitgeschakeld totdat u thinking: {type: "adaptive"} instelt in het verzoek. Zorg dat de configuratie aan beide zijden overeenkomt voordat u conclusies trekt uit de cijfers.
Waarom het goedkoopste model het duurst kan uitvallen
Neem een op zichzelf staande programmeertaak. Het verzoek bevat 60.000 tokens aan context en het model genereert 8.000 tokens aan output, inclusief het denkproces. Er wordt geen caching gebruikt, dus de berekening blijft inzichtelijk.
Op Opus 4.8: 0,06 MTok aan input à $5 kost $0,30, en 0,008 MTok aan output à $25 kost $0,20. De poging kost in totaal $0,50. Op Haiku 4.5 kost dezelfde poging $0,06 plus $0,04, oftewel $0,10.
Haiku is per poging vijf keer goedkoper, wat een aanzienlijk prijsverschil lijkt totdat u kijkt naar de gevolgen van een mislukte poging. U leest het foutieve antwoord, wat uw tijd kost. U stuurt het opnieuw mee als context bij de volgende poging, waardoor elke poging groter is dan de vorige. En wanneer de derde poging nog steeds niet voldoet, escaleert u alsnog: $0,30 aan Haiku plus $0,50 aan Opus is $0,80, oftewel 60% duurder dan in één keer Opus gebruiken.
De doorslaggevende vraag is dus hoe goedkoop u het antwoord kunt controleren. Wanneer een fout antwoord in één seconde duidelijk is, is het kleine model een koopje. Wanneer het opsporen ervan vereist dat u zorgvuldig een diff leest, kost het kleine model u tijd die nooit op de factuur verschijnt.
Wanneer een kleiner model de beste keuze is
Haiku 4.5 is in de volgende gevallen de juiste keuze:
- Mechanisch werk door subagents. Een subagent die bestanden hernoemt of zoekresultaten verzamelt, heeft geen geavanceerd redeneervermogen nodig. Dit is het standaardpatroon zodra u een AI-agent bouwt met Claude en deze voorziet van hulpfuncties.
- Log-triage. Bepalen of een regel ruis is of de aandacht van een mens vereist, is een beperkt oordeel met een duidelijk foutscenario.
- Classificatie op basis van een vaste set labels. De output is kort en de nauwkeurigheid is meetbaar aan de hand van een steekproef.
- Productieaanroepen met een hoog volume. Bij 100.000 uitvoeringen per dag is het verschil per token geen afrondingsfout meer. Dit is het gebruikelijke patroon voor AI-workflows gekoppeld aan n8n.
- Alles waarbij de responssnelheid voor de gebruiker van belang is. Haiku 4.5 wordt beoordeeld als het snelste model in de reeks.
Er is één beperking die specifiek voor Haiku geldt. De minimale cachebare prompt is 4.096 tokens, tegenover 1.024 bij Opus 4.8 en Sonnet 5. Onder dit minimum geldt: "verzoeken om minder dan dit aantal tokens te cachen, worden verwerkt zonder caching, en er wordt geen foutmelding geretourneerd". Een instructieblok van 1.500 tokens dat op Sonnet 5 wel wordt gecachet, wordt op Haiku 4.5 stilzwijgend niet gecachet. De aanwijzing hiervoor is dat cache_creation_input_tokens en cache_read_input_tokens beide op nul staan, wat het laag houden van de kosten voor een altijd actieve agent behandelt, naast de andere manieren waarop een cache verloren kan gaan.
De knoppen die het antwoord beïnvloeden
Elk van deze factoren heeft meer invloed op een factuur dan de modelnaam.
Effort. output_config.effort bepaalt hoeveel werk het model verricht voordat het antwoordt. De niveaus zijn low, medium, high, xhigh en max, waarbij high de standaard is: "Het instellen van effort op high levert exact hetzelfde gedrag op als het volledig weglaten van de effort-parameter." Deze parameter nestelt zich binnen output_config in plaats van op het hoogste niveau van het verzoek te staan:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)Effort heeft invloed op elk token in het antwoord: "Het kan alle tokenuitgaven beïnvloeden, inclusief tool-aanroepen. Een lagere effort betekent bijvoorbeeld dat Claude minder tool-aanroepen doet." Dit werkt cumulatief in een agent-loop. Het is geen tokenlimiet: "Effort is een gedragssignaal, geen strikt tokenbudget." Anthropic publiceert geen kostenvermenigvuldiger per niveau en adviseert om uw eigen use-case te testen. Een run van Sonnet 5 op high vergelijken met een run van Opus 4.8 op low is dus een valide vergelijking die u vandaag nog kunt uitvoeren. Haiku 4.5 ontbreekt in de lijst met modellen die effort ondersteunen.
Prompt caching. Een cache-read kost 0.1x het basistarief voor input, en de doorslaggevende factor voor de modelkeuze is wat dit doet over verschillende prijsniveaus heen. Een cache-hit op Opus 4.8 kost $0.50 / MTok, terwijl ongecachte input op Haiku 4.5 $1 / MTok kost. Een goed gecachte Opus-prefix is dus goedkoper per input-token dan een koude Haiku-prompt. Sessiehygiëne is belangrijker dan modelkeuze bij elke workload waarbij een grote, stabiele prefix opnieuw wordt verzonden.
Batches. Als er geen directe noodzaak is voor een antwoord, voert de Message Batches API dezelfde modellen uit met "een korting van 50% op zowel input- als output-tokens". Dit halveert elke rij in de onderstaande vergelijking en werkt over alle niveaus heen: een batch-job op Opus 4.8 kost minder dan een synchrone Sonnet 5-job tegen de standaardprijs vanaf 1 september 2026, waarbij latentie wordt ingeruild voor capaciteit tegen dezelfde kosten.
Kostenvergelijking per workload
De workload: het classificeren van 100.000 support-e-mails, één aanroep per stuk, 2.000 input-tokens en 300 output-tokens per aanroep. Dit komt neer op 200 MTok aan input en 30 MTok aan output.
- Haiku 4.5: 200 x $1 = $200 in, 30 x $5 = $150 uit. Totaal $350.
- Sonnet 5, introductietarief: 200 x $2 = $400 in, 30 x $10 = $300 uit. Totaal $700.
- Sonnet 5, vanaf 1 september 2026: 200 x $3 = $600 in, 30 x $15 = $450 uit. Totaal $1.050.
- Opus 4.8: 200 x $5 = $1.000 in, 30 x $25 = $750 uit. Totaal $1.750.
Pas vier getallen aan om de berekening uit te voeren met de prijzen van morgen. De onderstaande aanpassingen hebben meer invloed op het resultaat dan de modelnaam:
- Batching halveert elke regel: $175, $350, $525 en $875. Niets is afhankelijk van een classificatierun in de nacht, dus er is geen reden om dit over te slaan.
- Caching van het gedeelde voorvoegsel. Stel dat 1.200 van de 2.000 input-tokens elke keer hetzelfde instructieblok zijn. Bij Sonnet 5 tegen het introductietarief kosten deze $0,20 / MTok als cache-hits in plaats van $2 / MTok, dus 120 MTok kost $24 in plaats van $240. Voeg 80 MTok aan nieuwe input toe tegen $2, wat $160 is, plus $300 aan output, en Sonnet 5 komt uit op ongeveer $484 in plaats van $700. Dezelfde truc heeft geen effect bij Haiku 4.5, omdat 1.200 tokens onder het minimum van 4.096 tokens ligt.
- Retries. Stel dat u het antwoord van Haiku bij 8% van de e-mails afwijst en deze opnieuw uitvoert op Opus 4.8. Voeg 0,08 x $1.750 = $140 toe aan de $350, wat $490 oplevert. Meet uw eigen afwijzingspercentage in plaats van het mijne te gebruiken.
- Tool-definities, indien de taak deze gebruikt. De systeemprompt die ze genereren is 290 tokens op Opus 4.8 met
tool_choiceingesteld opauto, 354 op Sonnet 5 en 496 op Haiku 4.5. Het goedkoopste model heeft de grootste vaste overhead.
Haiku met een escalatiepad voor $490 en gecachte Sonnet 5 voor $484 kosten hetzelfde, en een van beide klaart de klus in één keer. Het model was nooit de enige factor in de vraagstelling.
Bespaart het wisselen van modellen tijdens een sessie geld?
Minder vaak dan de prijzen doen vermoeden, omdat de besparing per token geldt en u het risico loopt een volledig gecachte prefix te verliezen.
Anthropic documenteert wat een cache ongeldig maakt. Prefixes worden opgebouwd in de volgorde tools, daarna system, en vervolgens messages, waarbij "wijzigingen op elk niveau dat niveau en alle daaropvolgende niveaus ongeldig maken." Twee verzoekinstellingen staan ook op die lijst: "De thinking-configuratie en het opgeloste effort-niveau worden in de prompt zelf gerenderd, dus het wijzigen van een van deze instellingen start een nieuwe cache-prefix." Over de inspanning (effort) zijn de documenten nog duidelijker: "varieer de inspanning per werklast in plaats van binnen een gesprek dat afhankelijk is van cache-hits".
Het model staat niet op die gedocumenteerde lijst, dus ga er niet vanuit dat dit wel of niet invloed heeft. Lees cache_read_input_tokens bij het eerste verzoek na een wissel en laat het getal het antwoord geven. Bij een Opus 4.8-prefix van 150.000 tokens kost een cache-read ongeveer $0,08 en een nieuwe write ongeveer $0,94; dat is meer dan het prijsverschil per token dat u probeerde te besparen.
Wijzig deze instellingen dus tussen taken door, niet tijdens een lopende taak. In Claude Code betekent dit dat u eerst /clear uitvoert, wanneer de cache toch al wordt verwijderd, en daarna /model of /effort. Beide worden via de CLI ingevoerd. Als u op Linux werkt, is de terminalversie de installatie die de moeite waard is, aangezien wat Anthropic native levert voor Linux een stabiele CLI koppelt aan een desktop-app die nog in bèta is. Of de wissel daadwerkelijk op een factuur verschijnt, hangt af van hoe u voor die sessie betaalt, aangezien Claude Code werkt op basis van een vast maandelijks abonnement of via API-credits per token en alleen bij de tweede optie een modelwissel in dollars wordt verrekend.
Hoe u het antwoord op uw eigen workload test
Bepaal de omvang van een prompt niet op basis van een telling van een ander model. Het endpoint voor het tellen van tokens is gratis te gebruiken en telt met de tokenizer van het model dat u opgeeft; noem dus het model dat u van plan bent aan te roepen. Dat endpoint is een van de weinige onderdelen van het platform waarvoor nooit kosten in rekening worden gebracht, en wat u nog meer kunt uitvoeren zonder te betalen is het bekijken waard voordat u daadwerkelijk tegoed uitgeeft aan een vergelijking. Opus 4.7 en later, Fable 5 en Sonnet 5 gebruiken een nieuwere tokenizer die "ongeveer 30% meer tokens genereert voor dezelfde tekst". Een budget dat is gebaseerd op een ouder model, valt daarom lager uit bij een nieuwer model, terwijl het tarief per token ongewijzigd blijft.
Lees vervolgens wat er is geretourneerd. input_tokens is alleen het niet-gecachte restant, dus de werkelijke promptgrootte is dat veld plus cache_creation_input_tokens plus cache_read_input_tokens. Een eerste Claude API-app op een VPS is de meest betrouwbare plek om die meting uit te voeren, en welk Claude-abonnement bij uw gebruik past is de afzonderlijke beslissing of u überhaupt per token wilt betalen. Als het een vraag blijkt te zijn over welk abonnement u moet aanhouden in plaats van of u er een moet aanhouden, dan behandelt Claude's tarieven naast die van ChatGPT wat hetzelfde programmeerwerk kost bij de andere aanbieder. Als de meting ertoe leidt dat u uw werk definitief naar de API verplaatst, dan behoudt u na het verlagen of volledig opzeggen van het abonnement nog steeds de periode waarvoor u al heeft betaald; er is dus geen nadeel verbonden aan het nemen van een besluit zodra de cijfers bekend zijn.
FAQ
Welk Claude-model is het meest geschikt voor programmeren?
Claude Opus 4.8 is het gedocumenteerde startpunt voor complexe agent-gebaseerde programmeertaken, tegen $5 per miljoen input-tokens en $25 per miljoen output-tokens per juli 2026. Claude Sonnet 5 wordt gepositioneerd als de beste combinatie van snelheid en intelligentie, en met $2 / $10 tot 31 augustus 2026 kost het minder dan de helft. Voer dezelfde taak uit op beide modellen, houd de thinking-configuratie constant en vergelijk het totale tokenverbruik vanuit response.usage.
Is Claude Haiku 4.5 goedkoop genoeg om Sonnet 5 te vervangen?
Per token wel: $1 / $5 tegenover $2 / $10 voor Sonnet 5 tijdens de introductieperiode, of $3 / $15 vanaf 1 september 2026. De limieten zijn doorslaggevend. Haiku 4.5 heeft een contextvenster van 200K tokens in plaats van 1M, een maximale output van 64K op de synchrone Messages API, een betrouwbare kennis-cutoff van februari 2025, geen output_config.effort-ondersteuning en een cachebaar prompt-minimum van 4.096 tokens, waardoor caching bij korte systeem-prompts stilzwijgend wordt uitgeschakeld.
Bespaart het wisselen naar een goedkoper Claude-model tijdens een sessie geld?
Minder vaak dan het lijkt. Anthropic documenteert de cache-invalidators als wijzigingen aan de tools, system of messages prefix, wijzigingen in de thinking-configuratie en wijzigingen in output_config.effort. Wat een modelwissel doet met een bestaande cache is niet gedocumenteerd; ga er dus vanuit dat dit onbekend is en lees cache_read_input_tokens bij het eerste verzoek daarna. Het belang is duidelijk: bij een prefix van 150.000 tokens voor Opus 4.8 kost een cache-read ongeveer $0,08 en een nieuwe write ongeveer $0,94, wat zwaarder weegt dan de besparing per token over meerdere beurten. Wissel tussen taken, na /clear in Claude Code, wanneer de cache toch al wordt weggegooid.
Wat doet output_config.effort met mijn factuur?
Het verandert het aantal tokens dat het model besteedt aan tekst, tool-aanroepen en thinking. Een lagere effort resulteert in minder tool-aanroepen, wat cumulatief werkt bij agent-gebaseerde loops omdat elk tool-resultaat bij latere beurten opnieuw wordt verzonden. De niveaus zijn low, medium, high, xhigh en max, met high als standaard. Anthropic publiceert geen kostenvermenigvuldiger per niveau en noemt effort een gedragssignaal in plaats van een tokenbudget; meet dit daarom zelf bij uw specifieke taak.
Hoeveel bespaart de Claude Batches API?
50% op zowel input- als output-tokens, in ruil voor asynchrone levering. Per juli 2026 brengt dit Opus 4.8 op $2,50 in / $12,50 uit, Sonnet 5 op $1 / $5 tijdens de introductieperiode, en Haiku 4.5 op $0,50 / $2,50. De vergelijking die opvalt loopt over de verschillende niveaus: een batch-job met Opus 4.8 kost minder dan een synchrone Sonnet 5-job tegen het standaardtarief vanaf 1 september 2026; batching maakt het dus mogelijk om voor hetzelfde geld een krachtiger model in te zetten.