Kosten Claude geheugenfuncties: hoe werkt de facturatie?
De geheugenfunctie van Claude heeft geen eigen tarief. U betaalt voor onthouden tekst als invoertokens bij elk verzoek. Gebruik prompt caching om de kosten effectief te verlagen.
Brengen de geheugenfuncties van Claude extra kosten met zich mee?
De geheugenfuncties van Claude hebben geen eigen prijs. De gepubliceerde tarieven van Anthropic zijn per miljoen tokens aan invoer en per miljoen tokens aan uitvoer, met extra tarieven voor prompt caching, en geen daarvan wordt een geheugentoken genoemd. Het opslaan van het geheugen zelf kost niets via de Claude API (application programming interface), omdat de geheugentool aan de clientzijde draait en het bestand op uw eigen opslag staat.
Geheugen heeft nog steeds invloed op uw factuur, omdat een onthouden feit een antwoord alleen verandert wanneer het zich in het verzoek bevindt dat Claude leest. Onthouden betekent opnieuw verzenden. Die tekst komt aan als invoertokens en wordt in rekening gebracht tegen het standaard invoertarief van het model. Twee getallen bepalen de hoogte van de kosten: hoeveel tokens aan onthouden tekst u bij elke beurt opnieuw afspeelt, en of die afgespeelde tekst vanuit de prompt cache kan worden geserveerd.
Bij een Pro- of Max-abonnement wordt u helemaal niet per token gefactureerd, dus geheugen verbruikt uw gebruiksquotum in plaats van uw geld. Het onderstaande mechanisme is identiek. Alleen de eenheid verandert. Dat quotum is eindig, dus het is de moeite waard om te weten wat Claude Pro kost en bij welk punt de limieten u stoppen voordat u beslist hoeveel geheugen elke beurt moet bevatten. Claude Enterprise werkt weer anders, aangezien het elke token tegen API-tarieven meet bovenop de prijs per licentie, waardoor een te groot geheugenblok weer in geld verandert in plaats van in quotum. Als het opschonen van het geheugen uw verbruik weer comfortabel onder het plafond van een kleiner abonnement brengt, is overstappen van Max naar Pro de logische vervolgstap, en de wijziging gaat in aan het einde van de periode waarvoor u al heeft betaald. Als de vergelijking die u daadwerkelijk maakt tussen verschillende aanbieders is in plaats van tussen de eigen niveaus van Anthropic, dan is de vergelijking van Claude-abonnementen naast die van ChatGPT tegen de huidige prijzen het juiste startpunt.
Wat "geheugen" betekent op elk Claude-platform
Drie afzonderlijke producten delen dit woord, en het door elkaar halen ervan is de voornaamste reden waarom deze vraag verwarrend overkomt.
De memory tool op de Claude API. U voegt één item toe aan de tools array en implementeert de bestandsbewerkingen in uw eigen code.
{"type": "memory_20250818", "name": "memory"}Sinds augustus 2026 is deze tool algemeen beschikbaar op de Messages API zonder bèta-header, op Claude 4 en latere modellen. Het is client-side: Claude vraagt om een bewerking zoals view /memories, uw handler voert deze uit op opslag die u beheert, en u retourneert het resultaat in een tool_result blok. Anthropic bewaart het bestand nooit, dus er zijn geen opslagkosten die worden doorberekend. U betaalt in plaats daarvan voor de round-trip. De tooldefinitie wordt bij elk verzoek meegestuurd, en de bestandsinhoud die wordt geretourneerd, blijft vanaf dat punt in het gesprek aanwezig.
Anthropic publiceert het vaste deel van die overhead. Op Claude Opus 5 met een toolkeuze van auto is de tool-use system prompt 286 tokens, zoals gedocumenteerd in augustus 2026. Dat wordt eenmalig per verzoek betaald wanneer er een tool aanwezig is, of het nu om memory gaat of iets anders.
Claude Code. Twee mechanismen worden geladen aan het begin van elke sessie. CLAUDE.md bestanden bevatten instructies die u schrijft. Auto memory bevat notities die Claude voor zichzelf schrijft, onder ~/.claude/projects/<project>/memory/. Alleen de eerste 200 regels of 25KB van MEMORY.md wordt geladen, afhankelijk van welke limiet als eerste wordt bereikt, en de onderwerpsbestanden daarnaast worden op verzoek gelezen in plaats van bij het opstarten. Alles wat bij het opstarten wordt geladen, wordt onderdeel van het voorvoegsel dat elk later verzoek in die sessie met zich meedraagt. Hoe Claude Code geheugen ophaalt tussen sessies behandelt de laadvolgorde per bestand.
Claude op het web. Op claude.ai is geheugen een verzameling items die Claude schrijft en bijwerkt terwijl u chat, met een afzonderlijke geheugenruimte voor elk project. Settings > Memory toont wat er is opgeslagen, en de schakelaar daar biedt de optie Pause memory of Reset memory. Dit platform wordt gefactureerd via een abonnement, dus geheugen verbruikt hier gebruikslimieten.
Waarom onthouden tekst als input-tokens wordt gefactureerd
De Messages API is stateless. Deze slaat niets op tussen aanroepen, dus uw client verstuurt bij elke beurt het volledige gesprek en het model leest dit telkens opnieuw. Geheugen vormt hierop geen uitzondering. Het is simpelweg een extra tekstblok in hetzelfde verzoek.
De verdeling is zichtbaar in het usage-object van elk antwoord.
"usage": {
"input_tokens": 412,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 18240,
"output_tokens": 236
}input_tokens telt alleen de tokens die niet uit de cache zijn gelezen en ook niet zijn gebruikt om deze aan te maken; in de praktijk betekent dit de tokens na het laatste cache-breekpunt. De totale input voor het verzoek is cache_read_input_tokens plus cache_creation_input_tokens plus input_tokens. Een geheugenbestand dat Claude drie beurten geleden heeft geopend, bevindt zich bij elke volgende beurt in dat totaal. Het valt onder cache_read_input_tokens zolang het gecachte voorvoegsel behouden blijft, en onder input_tokens wanneer dat niet het geval is. Dezelfde tekst, twee zeer verschillende prijzen. Input- en output-tokens hebben verschillende prijzen, en geheugen valt altijd onder de input-zijde.
Waar u deze getallen in uw eigen gebruik kunt inzien
Neem geen cijfer over uit een blogpost, inclusief deze. Meet uw eigen geheugenblok. Het tellen van tokens is gratis en heeft een eigen limiet, dus de meting kost niets.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{"role": "user", "content": "Hello, Claude"}]
}'Het antwoord is één getal, zoals { "input_tokens": 14 }. Voer het eenmaal uit met uw geheugentekst geplakt in het system-veld en eenmaal zonder, en het verschil is wat dat geheugen u bij elke beurt kost. Er zijn twee waarschuwingen van toepassing. De telling is een schatting en extra tokens die Anthropic toevoegt voor eigen systeemoptimalisaties worden niet aan u gefactureerd. Tel bovendien tegen het model dat u daadwerkelijk gaat draaien, omdat Claude 4.7 en later een nieuwere tokenizer gebruiken die ongeveer 30 procent meer tokens genereert voor dezelfde tekst.
Binnen Claude Code wordt dezelfde vraag beantwoord zonder enige curl.
/contexttoont wat er op dit moment is geladen, inclusief geheugenbestanden, zodat u hun aandeel in het venster kunt zien voordat u iets typt./memorysomt uw CLAUDE.md-bestanden op en opent de map voor automatisch geheugen./usagedrukt de sessietotalen af, inclusief cache-reads en cache-writes.- De statusregel kan het gebruik van het contextvenster continu weergeven, zodat de groei zichtbaar is terwijl deze plaatsvindt.
Het /usage-sessieblok ziet er als volgt uit:
Total cost: $0.55
Total duration (API): 6m 20s
Total duration (wall): 6h 33m 10s
Total code changes: 0 lines added, 0 lines removed
Usage by model:
claude-sonnet-4-6: 1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)Lees de laatste regel zorgvuldig. Het getal van 940.0k cache read is het gesprek, inclusief geheugen en alles, dat bij elke beurt opnieuw wordt verzonden tegen het cache-tarief. Het input-getal van 1.2k is alleen het deel dat nieuw was. Claude Code berekent dat dollarbedrag lokaal op basis van de catalogusprijzen, dus het negeert eventuele kortingen die u heeft en kan afwijken van uw factuur. De pagina Usage in de Claude Console bevat het officiële getal.
Voer vervolgens de vergelijking direct uit. Stel dezelfde openingsvraag in twee nieuwe sessies, één normale en één met automatisch geheugen uitgeschakeld.
CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 claudeVoer /context uit in elk en vergelijk de invoer van de geheugenbestanden. Het verschil is wat uw opgebouwde geheugen kost aan het begin van elke sessie, voordat er enig werk wordt verricht. Een volledig overzicht van waar het tokengebruik van Claude Code naartoe gaat is het lezen waard naast die twee getallen.
Wat zijn de kosten per miljoen tokens voor het opnieuw afspelen van geheugen?
Prompt caching is de reden waarom hetzelfde geheugenblok de ene keer tien keer zoveel kan kosten als de andere keer. Anthropic publiceert de cachetarieven als veelvouden van de basis-inputprijs van elk model, waardoor de verhouding gelijk blijft, zelfs als de dollarprijzen wijzigen.
The data behind this chart
[
{
"label": "Base input",
"price_multiple": 1
},
{
"label": "5 minute cache write",
"price_multiple": 1.25
},
{
"label": "1 hour cache write",
"price_multiple": 2
},
{
"label": "Cache read",
"price_multiple": 0.1
}
]Een cache-read kost 0.1 keer de basis-inputprijs. Het schrijven van een item met een levensduur van 5 minuten kost 1.25 keer de basisprijs, en de levensduur van 1 uur kost 2 keer de basisprijs. Anthropic stelt het break-evenpunt duidelijk vast: caching is rendabel na één cache-read bij een duur van 5 minuten, of na twee cache-reads bij een duur van 1 uur. Het break-evenpunt voor prompt caching is de berekening die u moet uitvoeren voordat u bepaalt waar geheugen moet worden opgeslagen.
Deze veelvouden maken van het aantal herhalingen een rekenkundige kwestie. Het volgende blok is gebaseerd op de bovenstaande gepubliceerde veelvouden en is geen meting van een actieve workload. Het berekent de kosten van een geheugenblok op drie manieren over een sessie van 100 beurten, uitgedrukt als het equivalent aantal tokens tegen het standaardtarief voor basis-input.
The data behind this chart
[
{
"label": "4,000 tokens, never cached",
"base_rate_equivalent_tokens": "400,000"
},
{
"label": "4,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "44,600"
},
{
"label": "1,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "11,150"
}
]Een geheugenblok van 4.000 tokens dat bij alle 100 beurten de cache mist, wordt gefactureerd als 400,000 tokens tegen het basistarief. Hetzelfde blok met één cache-write van 5 minuten en 99 cache-reads wordt gefactureerd als 44,600. Als u dit blok verkleint tot een kwart van de omvang en de caching behoudt, wordt het gefactureerd als 11,150. De functionaliteit is in deze 3 rijen niet veranderd. Alleen het herhalingsgedrag is anders. Dit zijn nog steeds tokentellingen in plaats van bedragen, en het omzetten van een tokentelling naar een bedrag op uw maandelijkse factuur is een kwestie van één vermenigvuldiging met het tarief per miljoen van uw model. Dat tarief wordt bepaald door het model dat u gebruikt; als de agent op Claude Fable 5 draait, begin dan bij de gepubliceerde tarieven per miljoen en de taken waarvoor het geschikt is. Als de provider nog niet vaststaat, laat dezelfde taken berekend op de API van Claude en die van ChatGPT zien waar die vermenigvuldiging anders uitvalt, en een geheugenintensieve agent leunt zwaar op de inputzijde daarvan.
De tweede rij gaat ervan uit dat elk van de 99 latere verzoeken binnenkomt terwijl een cache-item nog actief is. Die aanname is waar de meeste werkelijke facturen afwijken.
Waarom kost dezelfde vraag meer na een pauze?
Een cache-item heeft een levensduur en de klok begint te lopen bij het verzoek dat het item schrijft of leest. De standaardinstelling is 5 minuten. De optie van 1 uur kost de 2x schrijfoperatie zoals hierboven weergegeven. In Claude Code is de levensduur één uur bij een abonnement, en deze daalt naar vijf minuten zodra u gebruikmaakt van verbruikstegoeden; bij een API-sleutel of een cloudprovider is de standaardinstelling vijf minuten. Het instellen van ENABLE_PROMPT_CACHING_1H=1 behoudt de levensduur van één uur terwijl u verbruikstegoeden gebruikt.
Een vraag van één regel die u typt in een sessie die u tijdens de lunch open hebt laten staan, is dus duur omdat het cache-item is verlopen terwijl u weg was. Het volledige voorvoegsel, inclusief het geheugen, wordt opnieuw verwerkt tegen het basistarief voor invoer en opnieuw naar de cache geschreven. De duur van de pauze bepaalde die prijs.
U kunt dit verifiëren in plaats van het aan te nemen. Bij een Pro-, Max-, Team- of Enterprise-abonnement markeert de /usage-uitsplitsing elk gedrag dat verantwoordelijk is voor 10 procent of meer van het recente verbruik, en zowel lange context als cache-missers verschijnen daar bij naam. Houd bij de API in de gaten hoe cache_creation_input_tokens bij het eerste verzoek na een rustige periode weer omhoog springt naar de volledige grootte van uw voorvoegsel.
Wat maakt de cache stilletjes ongeldig
Het gecachte voorvoegsel is geordend: tools, dan systeem, dan berichten. Een wijziging op één niveau maakt dat niveau en alles wat daarna komt ongeldig. Het bewerken van een tool-definitie gooit de volledige cache weg. Het bewerken van de systeem-prompt gooit de systeem- en berichtencache weg.
Dit is de valkuil voor iedereen die geheugen in de systeem-prompt bijhoudt en dit herschrijft naarmate de agent leert. Elke herschrijving verwijdert de gecachte kopie van alles wat erachter staat, waardoor het volgende verzoek opnieuw een volledige schrijfactie vereist. Houd stabiel materiaal aan het begin en houd het ongewijzigd, en laat vluchtig materiaal achteraan in de berichtenlijst staan, waar het ongeldig maken ervan goedkoop is.
Er is een tweede, stillere fout. Elk model heeft een minimaal cachebaar voorvoegsel: 512 tokens op Claude Opus 5, 1.024 op Claude Sonnet 5, 4.096 op Claude Haiku 4.5, zoals gepubliceerd in augustus 2026. De documentatie van Anthropic is expliciet over wat er gebeurt onder deze grens: "Alle verzoeken om minder dan dit aantal tokens te cachen worden verwerkt zonder caching, en er wordt geen foutmelding geretourneerd." Een klein geheugenbestand gemarkeerd met cache_control doet daarom helemaal niets, zonder enige melding. Het symptoom dat u kunt waarnemen is dat cache_creation_input_tokens op 0 blijft staan, terwijl uw prompt duidelijk een breakpoint bevat.
Geheugen opschonen dat niet langer relevant is
Elke regel geheugen kost tokens bij elke beurt waarin deze wordt meegedragen. De vraag is daarom voor elke regel of deze recentelijk een antwoord heeft beïnvloed. Claude Code maakt de limieten concreet. Streef ernaar om een CLAUDE.md onder de 200 regels te houden, omdat langere bestanden meer context verbruiken en de betrouwbaarheid waarmee Claude ze volgt, verminderen. MEMORY.md is bij het laden beperkt tot de eerste 200 regels of 25KB; alles wat die limiet overschrijdt, wordt bij de start van de volgende sessie verwijderd. Een te grote index kost dus tokens zonder waarde toe te voegen.
Twee gewoontes houden het bestand klein. Verplaats details uit de index naar onderwerpspecifieke bestanden, die Claude op verzoek leest in plaats van bij het opstarten. Verplaats workflow-instructies uit CLAUDE.md naar skills, die alleen worden geladen wanneer ze worden aangeroepen. Voor geheugenbestanden die al beginnen met frontmatter, registreert Claude Code in versie 2.1.214 of later de schrijftijd in een modified-veld als een ISO 8601-tijdstempel. Dat tijdstempel is de snelste manier om verouderde informatie te identificeren. Verouderd agentgeheugen opschonen doorloopt het beoordelingsproces in meer detail.
Wanneer ophalen beter is dan alles in de context laden
De memory tool is ontworpen om just-in-time ophalen te ondersteunen. In plaats van alles vooraf te laden, legt de agent vast wat hij leert en leest hij een bestand pas in wanneer een taak dit vereist. Dit verandert de berekening, omdat het lezen van een bestand eenmalig tokens kost en het daarna in het gecachte voorvoegsel blijft staan, terwijl een permanent geladen blok bij elke beurt kosten met zich meebrengt.
Uit de twee bovenstaande grafieken volgt een eenvoudige regel. Tekst die bijna elke beurt wordt gebruikt, hoort in het stabiele gecachte voorvoegsel thuis. Tekst die één op de twintig beurten wordt gebruikt, hoort achter een view-aanroep. Het omslagpunt verschuift op basis van uw aantal herhalingen, niet op basis van de kosten van Anthropic.
Via de API kunt u het platform ook de conversatie laten inkorten. Context editing wist oude toolresultaten zodra de conversatie een door u ingestelde drempel overschrijdt.
{
"edits": [
{
"type": "clear_tool_uses_20250919",
"trigger": {"type": "input_tokens", "value": 30000},
"keep": {"type": "tool_uses", "value": 3},
"clear_at_least": {"type": "input_tokens", "value": 5000}
}
]
}De standaardinstellingen zijn een trigger van 100.000 input tokens en het behoud van 3 tool-gebruiken. Lees de interactie met caching door voordat u deze inschakelt: het wissen van inhoud maakt het gecachte voorvoegsel ongeldig op het punt van de verwijdering, waardoor u bij het volgende verzoek opnieuw betaalt voor een cache-schrijfactie. Dat is waar clear_at_least voor dient. Het stelt het wissen uit totdat de besparing groot genoeg is om de schrijfactie te rechtvaardigen. Het antwoord rapporteert precies wat er is gebeurd onder context_management, met cleared_tool_uses en cleared_input_tokens, zodat de afweging meetbaar is in plaats van theoretisch. Het beheren van het contextvenster in Claude Code past hetzelfde principe toe op een programmeersessie.
Wat heeft een eigen kostenpost
Geheugen brengt geen eigen kosten met zich mee, maar sommige functies doen dat wel, en het is nuttig om te weten welke dit zijn. Dit zijn de gepubliceerde Claude API-tarieven per augustus 2026. Enkele bewerkingen kosten niets, maar er is geen gratis laag voor de Claude API, enkel een klein tegoed bij aanmelding. Alles hieronder zijn dus directe kosten vanaf uw eerste verzoek.
- Zoeken op het web: $10 per 1.000 zoekopdrachten, plus de gebruikelijke tokenkosten voor alles wat de zoekopdracht in de context plaatst.
- Code-uitvoering: 1.550 gratis uren per organisatie per maand, daarna $0,05 per uur per container. Het gebruik is gratis wanneer dit wordt gecombineerd met zoeken op het web of het ophalen van webpagina's.
- Claude Managed Agents: sessieduur tegen $0,08 per sessie-uur, bovenop de gebruikelijke tokenkosten.
- Web fetch: geen extra kosten, enkel de tokenkosten voor de opgehaalde inhoud.
Geheugen staat op geen van deze regels. Het verschijnt in uw input-tokentelling; dit is precies waar u het kunt meten en waar snoeien en cachen de kosten kunnen verlagen. Als u een budget opstelt voor een agent die onbeheerd op een virtual private server (VPS) draait, zijn de kostencontroles voor een AI-agent op een VPS de volgende stap om in te richten. Een agent met een groeiend geheugenbestand zonder snoeiproces wordt namelijk elke week duurder zonder dat dit ergens wordt gerapporteerd.
FAQ
Worden er extra kosten in rekening gebracht voor de geheugenfuncties van Claude?
Nee. De prijslijst van Anthropic bevat tarieven per miljoen input-tokens, per miljoen output-tokens en de vermenigvuldigers voor prompt-caching; er is geen aparte post voor geheugen. Bij de Claude API is de geheugentool client-side, waardoor de bestanden worden opgeslagen op opslag waarvoor u al betaalt. Wat geheugen toevoegt zijn input-tokens, die bij elke beurt die ze bevatten tegen het normale input-tarief van het model worden gefactureerd.
Wordt Claude goedkoper als ik het geheugen uitschakel?
Het verlaagt het aantal tokens per verzoek, wat de kosten per verzoek verlaagt. Of dit per saldo geld bespaart, hangt af van wat er daarna gebeurt. Als Claude drie bestanden opnieuw moet lezen en u twee vragen moet stellen om te reconstrueren wat het geheugen al bevatte, kosten die tokens meer dan het geheugen deed. Meet het in plaats van te gokken: voer /context uit in een sessie met automatisch geheugen ingeschakeld en in een sessie gestart met CLAUDE_CODE_DISABLE_AUTO_MEMORY=1, en vergelijk vervolgens het totale aantal tokens dat aan dezelfde taak is besteed.
Waarom is mijn verbruik gestegen terwijl ik niets heb veranderd?
De meest voorkomende oorzaak is een cache-miss na een pauze. Cache-items blijven standaard 5 minuten bewaard, of één uur bij de uitgebreide instelling, dus het eerste verzoek na een pauze verwerkt uw volledige prefix opnieuw tegen het basis-inputtarief en schrijft deze opnieuw. De tweede veelvoorkomende oorzaak is een wijziging in de prefix: het wijzigen van een tool-definitie maakt de hele cache ongeldig, en het wijzigen van de system prompt maakt de systeem- en berichtencache ongeldig. Bij een abonnement benoemt het /usage-overzicht dit gedrag wanneer het 10 procent of meer van het recente verbruik beslaat.
Moet geheugen in de system prompt staan of achter een tool call?
Plaats het in de system prompt wanneer bijna elke beurt er gebruik van maakt, omdat het dan in de gecachte prefix staat en tegen het cache-leestarief wordt berekend. Plaats het achter een view-aanroep wanneer slechts sommige taken het nodig hebben, omdat een bestand dat één keer wordt gelezen zijn tokens één keer kost in plaats van bij elke beurt. Het doorslaggevende getal is uw replay-aantal, en het usage-object geeft u dat getal direct.
Tellen geheugenfuncties mee voor de verbruikslimieten van het abonnement?
Ja, indirect, omdat de limieten van het abonnement worden verbruikt door de tokens die elk verzoek bevat. De helpdocumentatie van Anthropic stelt dat langere gesprekken die automatisch contextbeheer activeren, meer van uw verbruikslimiet opsnoepen. Geheugen maakt elk verzoek iets langer, en een lange sessie speelt die lengte bij elke beurt opnieuw af. Hoe de verbruikslimieten van Claude daadwerkelijk werken beschrijft wat wanneer wordt gereset.