SSD Nodes Learn 🎉 VPS vanaf $5.50/mnd
Gidsen Matt ConnorDoor Matt Connor · Bijgewerkt 2026-08-14

Kosten van Claude geheugenfuncties uitgelegd

Er is geen apart tarief voor geheugen, maar onthouden tekst telt als input-tokens. Uw kosten hangen af van de hoeveelheid herhaalde data en het gebruik van prompt caching.

Brengen de geheugenfuncties van Claude extra kosten met zich mee?

De geheugenfuncties van Claude hebben geen eigen prijs. De gepubliceerde tarieven van Anthropic gelden per miljoen tokens aan input en per miljoen tokens aan output, met aanvullende tarieven voor prompt caching; er is geen sprake van een zogeheten geheugentoken. Het opslaan van het geheugen zelf kost niets via de Claude API (application programming interface), omdat de geheugentool client-side is en het bestand zich op uw eigen opslag bevindt.

Geheugen wordt wel verrekend in uw factuur, omdat een onthouden feit een antwoord alleen beïnvloedt wanneer het zich in het verzoek bevindt dat Claude leest. Onthouden betekent opnieuw verzenden. Die tekst komt aan als input-tokens en wordt belast tegen het reguliere inputtarief van het model. Twee getallen bepalen de hoogte van de kosten: hoeveel tokens aan onthouden tekst u bij elke beurt opnieuw afspeelt, en of die opnieuw afgespeelde tekst vanuit de prompt cache kan worden geserveerd.

Bij een Pro- of Max-abonnement wordt u niet per token gefactureerd, waardoor geheugengebruik ten koste gaat van uw gebruiksquotum in plaats van uw geld. Het onderliggende mechanisme is identiek. Alleen de eenheid verandert. Dat quotum is eindig, dus het is zinvol om te weten wat Claude Pro kost en bij welk punt de limieten u beperken voordat u besluit hoeveel geheugen elke beurt moet bevatten. Claude Enterprise werkt weer anders, aangezien elk token tegen API-tarieven wordt gemeten bovenop de prijs per seat, waardoor een te groot geheugenblok weer in geld wordt omgezet in plaats van in quotum. Als het opschonen van het geheugen uw verbruik weer comfortabel onder het plafond van een kleiner abonnement brengt, is overstappen van Max naar Pro de logische vervolgstap; de wijziging gaat in aan het einde van de periode waarvoor u al heeft betaald. Als u de vergelijking niet tussen de verschillende niveaus van Anthropic maakt, maar tussen verschillende aanbieders, dan is de vergelijking van Claude-abonnementen naast die van ChatGPT tegen de huidige prijzen het juiste startpunt.

Wat "geheugen" betekent op elk Claude-platform

Drie afzonderlijke producten delen dit woord, en het door elkaar halen ervan is de voornaamste reden waarom deze vraag verwarrend overkomt.

De geheugentool in de Claude API. U voegt één item toe aan de tools array en implementeert de bestandsbewerkingen in uw eigen code.

{"type": "memory_20250818", "name": "memory"}

Sinds augustus 2026 is deze tool algemeen beschikbaar in de Messages API zonder bèta-header, op Claude 4 en latere modellen. Het is client-side: Claude vraagt om een bewerking zoals view /memories, uw handler voert deze uit op opslag die u beheert, en u retourneert het resultaat in een tool_result blok. Anthropic slaat het bestand nooit op, dus er zijn geen opslagkosten die worden doorberekend. U betaalt in plaats daarvan voor de round-trip. De tooldefinitie wordt bij elk verzoek meegestuurd, en de bestandsinhoud die wordt geretourneerd, blijft vanaf dat punt in het gesprek aanwezig.

Anthropic publiceert het vaste deel van die overhead. Op Claude Opus 5 met een toolkeuze van auto is de systeem-prompt voor toolgebruik 286 tokens, zoals gedocumenteerd in augustus 2026. Dit wordt eenmalig per verzoek betaald wanneer er een tool aanwezig is, of het nu om geheugen gaat of iets anders.

Claude Code. Twee mechanismen laden aan het begin van elke sessie. CLAUDE.md-bestanden bevatten instructies die u schrijft. Automatisch geheugen bevat notities die Claude voor zichzelf schrijft, onder ~/.claude/projects/<project>/memory/. Alleen de eerste 200 regels of 25KB van MEMORY.md wordt geladen, afhankelijk van welke limiet als eerste wordt bereikt, en de onderwerpsbestanden daarnaast worden op aanvraag gelezen in plaats van bij het opstarten. Alles wat bij het opstarten wordt geladen, wordt onderdeel van het voorvoegsel dat elk later verzoek in die sessie met zich meedraagt. Hoe Claude Code geheugen ophaalt tussen sessies behandelt de laadvolgorde per bestand.

Claude op het web. Op claude.ai is geheugen een verzameling items die Claude schrijft en bijwerkt terwijl u chat, met een afzonderlijke geheugenruimte voor elk project. Instellingen > Geheugen toont wat er is opgeslagen, en de schakelaar daar biedt de optie Geheugen pauzeren of Geheugen resetten. Dit platform wordt gefactureerd via een abonnement, dus geheugen verbruikt hier uw gebruikslimieten.

Waarom onthouden tekst als input-tokens wordt gefactureerd

De Messages API is stateless. Deze houdt niets bij tussen aanroepen, dus uw client verstuurt bij elke beurt het volledige gesprek en het model leest dit telkens opnieuw. Geheugen vormt geen uitzondering op die regel. Het is simpelweg een extra tekstblok in hetzelfde verzoek.

De verdeling is zichtbaar in het usage-object van elk antwoord.

"usage": {
  "input_tokens": 412,
  "cache_creation_input_tokens": 0,
  "cache_read_input_tokens": 18240,
  "output_tokens": 236
}

input_tokens telt alleen de tokens die noch uit de cache zijn gelezen, noch zijn gebruikt om deze te creëren; in de praktijk betekent dit de tokens na het laatste cache-breekpunt. De totale input voor het verzoek is cache_read_input_tokens plus cache_creation_input_tokens plus input_tokens. Een geheugenbestand dat Claude drie beurten geleden heeft geopend, bevindt zich bij elke daaropvolgende beurt in dat totaal. Het valt onder cache_read_input_tokens zolang het gecachte voorvoegsel behouden blijft, en onder input_tokens wanneer dat niet het geval is. Dezelfde tekst, twee zeer verschillende prijzen. Input- en output-tokens hebben verschillende prijzen, en geheugen valt altijd aan de input-zijde.

Waar u deze getallen in uw eigen gebruik kunt inzien

Neem geen cijfer over uit een blogpost, inclusief deze. Meet uw eigen geheugenblok. Het tellen van tokens is gratis en heeft een eigen limiet, dus de meting kost niets.

curl https://api.anthropic.com/v1/messages/count_tokens \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "content-type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "system": "You are a scientist",
    "messages": [{"role": "user", "content": "Hello, Claude"}]
  }'

Het antwoord is één getal, zoals { "input_tokens": 14 }. Voer het eenmaal uit met uw geheugentekst geplakt in het system-veld en eenmaal zonder, en het verschil is wat dat geheugen u bij elke beurt kost. Er zijn twee waarschuwingen van toepassing. De telling is een schatting en extra tokens die Anthropic toevoegt voor eigen systeemoptimalisaties worden niet aan u gefactureerd. Tel bovendien tegen het model dat u daadwerkelijk gaat draaien, omdat Claude 4.7 en later een nieuwere tokenizer gebruiken die ongeveer 30 procent meer tokens genereert voor dezelfde tekst.

Binnen Claude Code wordt dezelfde vraag beantwoord zonder enige curl.

  • /context toont wat er op dit moment is geladen, inclusief geheugenbestanden, zodat u hun aandeel in het venster kunt zien voordat u iets typt.
  • /memory somt uw CLAUDE.md-bestanden op en opent de map voor automatisch geheugen.
  • /usage drukt de sessietotalen af, inclusief cache-reads en cache-writes.
  • De statusregel kan het gebruik van het contextvenster continu weergeven, zodat groei zichtbaar is terwijl deze plaatsvindt.

Het /usage-sessieblok ziet er als volgt uit:

Total cost:            $0.55
Total duration (API):  6m 20s
Total duration (wall): 6h 33m 10s
Total code changes:    0 lines added, 0 lines removed
Usage by model:
   claude-sonnet-4-6:  1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)

Lees de laatste regel zorgvuldig. Het cijfer 940.0k cache read is het gesprek, inclusief geheugen en alles, dat bij elke beurt opnieuw wordt verzonden tegen het cache-tarief. Het cijfer 1.2k input is alleen het deel dat nieuw was. Claude Code berekent dat dollarbedrag lokaal op basis van catalogusprijzen, dus het negeert eventuele kortingen die u heeft en kan afwijken van uw factuur. De pagina Usage in de Claude Console bevat het officiële getal.

Voer vervolgens de vergelijking direct uit. Stel dezelfde openingsvraag in twee nieuwe sessies, één normale en één met automatisch geheugen uitgeschakeld.

CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 claude

Voer /context uit in elk en vergelijk de invoer van de geheugenbestanden. Het verschil is wat uw opgebouwde geheugen kost aan het begin van elke sessie, voordat er enig werk wordt verricht. Een volledig overzicht van waar het tokengebruik van Claude Code naartoe gaat is het waard om naast die twee getallen te lezen.

Wat zijn de kosten per miljoen tokens voor het opnieuw gebruiken van geheugen?

Prompt caching is de reden waarom hetzelfde geheugenblok de ene keer tien keer zoveel kan kosten als de andere keer. Anthropic publiceert de cachetarieven als veelvouden van de basis-inputprijs van elk model, waardoor de verhouding gelijk blijft, zelfs als de dollar-prijzen wijzigen.

ChartAnthropic's published prompt caching rates, as a multiple of base input price
The data behind this chart
[
  {
    "label": "Base input",
    "price_multiple": 1
  },
  {
    "label": "5 minute cache write",
    "price_multiple": 1.25
  },
  {
    "label": "1 hour cache write",
    "price_multiple": 2
  },
  {
    "label": "Cache read",
    "price_multiple": 0.1
  }
]

Een cache-read kost 0.1 keer de basis-inputprijs. Het schrijven van een item met een levensduur van 5 minuten kost 1.25 keer de basisprijs, en de levensduur van 1 uur kost 2 keer de basisprijs. Anthropic stelt het omslagpunt duidelijk vast: caching is rendabel na één cache-read bij een duur van 5 minuten, of na twee cache-reads bij een duur van 1 uur. Het omslagpunt voor prompt caching is de berekening die u moet uitvoeren voordat u bepaalt waar geheugen moet worden ondergebracht.

Deze veelvouden maken van het aantal herhalingen een rekenkundige kwestie. Het volgende blok is gebaseerd op de bovenstaande gepubliceerde veelvouden en is geen meting van een actuele workload. Het berekent de kosten van een geheugenblok op drie manieren over een sessie van 100 beurten, uitgedrukt in het equivalente aantal tokens berekend tegen het standaard basis-inputtarief.

ChartA memory block over 100 turns, expressed as base-rate input tokens
The data behind this chart
[
  {
    "label": "4,000 tokens, never cached",
    "base_rate_equivalent_tokens": "400,000"
  },
  {
    "label": "4,000 tokens, 1 write and 99 reads",
    "base_rate_equivalent_tokens": "44,600"
  },
  {
    "label": "1,000 tokens, 1 write and 99 reads",
    "base_rate_equivalent_tokens": "11,150"
  }
]

Een geheugenblok van 4.000 tokens dat bij alle 100 beurten de cache mist, wordt gefactureerd als 400,000 tokens tegen het basistarief. Hetzelfde blok met één cache-write van 5 minuten en 99 cache-reads wordt gefactureerd als 44,600. Als u dit blok verkleint tot een kwart van de omvang en de caching behoudt, wordt het gefactureerd als 11,150. De functionaliteit is over deze 3 rijen niet veranderd. Alleen het herhalingsgedrag is anders. Dit zijn nog steeds tokentellingen in plaats van geldbedragen, en het omzetten van een tokentelling naar een bedrag op uw maandelijkse factuur is een kwestie van één vermenigvuldiging met het tarief per miljoen van uw model. Dat tarief wordt bepaald door het model dat u gebruikt; als de agent op Claude Fable 5 zal draaien, begin dan bij de gepubliceerde tarieven per miljoen en het type werk waarvoor het geschikt is.

De tweede rij gaat ervan uit dat elk van de 99 latere verzoeken binnenkomt terwijl een cache-item nog actief is. Die aanname is waar de meeste werkelijke facturen afwijken.

Waarom kost dezelfde vraag meer na een pauze?

Een cache-item heeft een levensduur en de klok begint te lopen bij het verzoek dat het item schrijft of leest. De standaardinstelling is 5 minuten. De optie van 1 uur kost de 2x schrijfactie zoals hierboven getoond. In Claude Code is de levensduur één uur bij een abonnement, en deze daalt naar vijf minuten zodra u gebruikmaakt van verbruikstegoeden; bij een API-sleutel of een cloudprovider is de standaardinstelling vijf minuten. Het instellen van ENABLE_PROMPT_CACHING_1H=1 behoudt de levensduur van één uur terwijl u verbruikstegoeden gebruikt.

Een vraag van één regel die u typt in een sessie die u tijdens de lunch open hebt laten staan, is dus duur omdat het cache-item is verlopen terwijl u weg was. Het volledige voorvoegsel, inclusief het geheugen, wordt opnieuw verwerkt tegen het basistarief voor invoer en opnieuw naar de cache geschreven. De duur van de pauze bepaalde die prijs.

U kunt dit verifiëren in plaats van het aan te nemen. Bij een Pro-, Max-, Team- of Enterprise-abonnement markeert de /usage-uitsplitsing elk gedrag dat verantwoordelijk is voor 10 procent of meer van het recente verbruik, en zowel lange context als cache-missers verschijnen daar bij naam. Houd bij de API in de gaten hoe cache_creation_input_tokens bij het eerste verzoek na een rustige periode weer omhoog springt naar de volledige grootte van uw voorvoegsel.

Wat de cache stilletjes ongeldig maakt

Het gecachte voorvoegsel is geordend: tools, dan systeem, dan berichten. Een wijziging op één niveau maakt dat niveau en alles wat daarna komt ongeldig. Het bewerken van een tool-definitie gooit de volledige cache weg. Het bewerken van de systeem-prompt gooit de systeem- en berichtencache weg.

Dit is de valkuil voor iedereen die geheugen in de systeem-prompt bijhoudt en dit herschrijft naarmate de agent leert. Elke herschrijving verwijdert de gecachte kopie van alles wat erachter staat, waardoor het volgende verzoek opnieuw een volledige schrijfactie vereist. Houd stabiel materiaal aan het begin en houd het ongewijzigd, en laat vluchtig materiaal laat in de berichtenlijst staan, waar het ongeldig maken ervan goedkoop is.

Er is een tweede, stillere fout. Elk model heeft een minimaal cachebaar voorvoegsel: 512 tokens op Claude Opus 5, 1.024 op Claude Sonnet 5, 4.096 op Claude Haiku 4.5, zoals gepubliceerd in augustus 2026. De documentatie van Anthropic is expliciet over wat er gebeurt onder deze grens: "Elk verzoek om minder dan dit aantal tokens te cachen wordt verwerkt zonder caching, en er wordt geen foutmelding geretourneerd." Een klein geheugenbestand gemarkeerd met cache_control doet daarom helemaal niets, zonder enige melding. Het symptoom dat u kunt waarnemen is dat cache_creation_input_tokens op 0 blijft staan, terwijl uw prompt duidelijk een breakpoint bevat.

Verwijder geheugen dat niet langer relevant is

Elke regel geheugen kost tokens bij elke beurt waarin deze wordt meegedragen. De vraag voor elke regel is dus of deze recentelijk een antwoord heeft beïnvloed. Claude Code maakt de limieten concreet. Streef ernaar om een CLAUDE.md onder de 200 regels te houden, omdat langere bestanden meer context verbruiken en de betrouwbaarheid waarmee Claude ze volgt, verminderen. MEMORY.md wordt bij het laden beperkt tot de eerste 200 regels of 25KB; alles wat die limiet overschrijdt, wordt bij de start van de volgende sessie verwijderd. Een te groot indexbestand kost dus tokens zonder waarde toe te voegen.

Twee gewoontes houden het bestand compact. Verplaats details uit de index naar onderwerpbestanden, die Claude op verzoek leest in plaats van bij het opstarten. Verplaats workflow-instructies uit CLAUDE.md naar skills, die alleen worden geladen wanneer ze worden aangeroepen. Voor geheugenbestanden die al beginnen met frontmatter, legt Claude Code in versie 2.1.214 of later de schrijftijd vast in een modified-veld als een ISO 8601-tijdstempel. Dat tijdstempel is de snelste manier om verouderde informatie te identificeren. Het opschonen van verouderd agentgeheugen behandelt het beoordelingsproces in meer detail.

Wanneer ophalen beter is dan alles in de context laden

De memory-tool is ontworpen om just-in-time ophalen te ondersteunen. In plaats van alles vooraf te laden, legt de agent vast wat hij leert en leest hij een bestand pas in wanneer een taak dit vereist. Dit verandert de berekening, omdat het lezen van een bestand eenmalig tokens kost en het daarna in het gecachte voorvoegsel blijft staan, terwijl een permanent geladen blok bij elke beurt kosten met zich meebrengt.

Uit de twee bovenstaande grafieken volgt een eenvoudige regel. Tekst die bijna elke beurt wordt gebruikt, hoort in het stabiele gecachte voorvoegsel thuis. Tekst die in één op de twintig beurten wordt gebruikt, hoort achter een view-aanroep thuis. Het omslagpunt verschuift op basis van uw aantal herhalingen, niet op basis van de tarieven van Anthropic.

Via de API kunt u het platform ook het gesprek laten inkorten. Context editing verwijdert oude toolresultaten zodra het gesprek een door u ingestelde drempel overschrijdt.

{
  "edits": [
    {
      "type": "clear_tool_uses_20250919",
      "trigger": {"type": "input_tokens", "value": 30000},
      "keep": {"type": "tool_uses", "value": 3},
      "clear_at_least": {"type": "input_tokens", "value": 5000}
    }
  ]
}

De standaardinstellingen zijn een trigger van 100.000 input-tokens en het behoud van 3 tool-gebruiken. Lees de interactie met caching door voordat u deze inschakelt: het wissen van inhoud maakt het gecachte voorvoegsel ongeldig op het punt van de verwijdering, waardoor u bij het volgende verzoek opnieuw betaalt voor een cache-schrijfactie. Dat is waar clear_at_least voor dient. Het stelt het wissen uit totdat de besparing groot genoeg is om de schrijfactie te rechtvaardigen. Het antwoord rapporteert precies wat er is gebeurd onder context_management, met cleared_tool_uses en cleared_input_tokens, zodat de afweging meetbaar is in plaats van theoretisch. Het beheren van het contextvenster in Claude Code past hetzelfde principe toe op een programmeersessie.

Wat heeft een eigen kostenpost

Geheugen heeft geen eigen kosten, maar sommige functies wel, en het is nuttig om te weten welke dit zijn. Dit zijn de gepubliceerde Claude API-tarieven per augustus 2026. Enkele bewerkingen kosten niets, maar er is geen gratis laag voor de Claude API, enkel een klein tegoed bij aanmelding, dus alles hieronder zijn directe kosten vanaf uw eerste verzoek.

  • Web search: $10 per 1.000 zoekopdrachten, plus de gebruikelijke tokenkosten voor alles wat de zoekopdracht in de context plaatst.
  • Code execution: 1.550 gratis uren per organisatie per maand, daarna $0,05 per uur per container. Het is gratis wanneer het wordt gebruikt in combinatie met web search of web fetch.
  • Claude Managed Agents: sessieduur tegen $0,08 per sessie-uur, bovenop de gebruikelijke tokenkosten.
  • Web fetch: geen extra kosten, enkel de tokenkosten van de opgehaalde inhoud.

Geheugen staat op geen van deze regels. Het verschijnt in uw input-tokentelling; dit is precies waar u het kunt meten en waar snoeien (pruning) en caching het kunnen verminderen. Als u een budget opstelt voor een agent die onbeheerd op een virtual private server (VPS) draait, zijn de kostencontroles voor een AI-agent op een VPS de volgende stap om in te stellen, omdat een agent met een groeiend geheugenbestand zonder snoeien elke week duurder wordt zonder dat dit ergens wordt gerapporteerd.

FAQ

Worden de geheugenfuncties van Claude apart in rekening gebracht?

Nee. De prijslijst van Anthropic bevat tarieven per miljoen input-tokens, per miljoen output-tokens en de vermenigvuldigers voor prompt caching; er is geen aparte post voor geheugen. In de Claude API is de geheugentool client-side, waardoor de bestanden worden opgeslagen op opslag waarvoor u al betaalt. Wat geheugen toevoegt zijn input-tokens, die bij elke beurt die ze bevatten tegen het normale input-tarief van het model worden gefactureerd.

Wordt Claude goedkoper als ik het geheugen uitschakel?

Het verlaagt het aantal tokens per verzoek, wat de kosten per verzoek verlaagt. Of dit per saldo geld bespaart, hangt af van wat er daarna gebeurt. Als Claude drie bestanden opnieuw moet lezen en u twee vragen moet stellen om te reconstrueren wat het geheugen al bevatte, kosten die tokens meer dan het geheugen deed. Meet het in plaats van te gokken: voer /context uit in een sessie met automatisch geheugen ingeschakeld en in een sessie die is gestart met CLAUDE_CODE_DISABLE_AUTO_MEMORY=1, en vergelijk vervolgens het totale aantal tokens dat aan dezelfde taak is besteed.

Waarom is mijn verbruik gestegen terwijl ik niets heb veranderd?

De meest voorkomende oorzaak is een cache-miss na een pauze. Cache-items blijven standaard 5 minuten bewaard, of één uur bij de uitgebreide instelling, dus het eerste verzoek na een pauze verwerkt uw volledige prefix opnieuw tegen het basis-inputtarief en schrijft deze opnieuw weg. De tweede veelvoorkomende oorzaak is een wijziging in de prefix: het wijzigen van een tool-definitie maakt de volledige cache ongeldig, en het wijzigen van de system prompt maakt de systeem- en berichtencache ongeldig. Bij een abonnement benoemt het /usage-overzicht dit gedrag wanneer het 10 procent of meer van het recente verbruik beslaat.

Moet geheugen in de system prompt staan of achter een tool call?

Plaats het in de system prompt wanneer bijna elke beurt er gebruik van maakt, omdat het dan in de gecachte prefix staat en tegen het cache-leestarief wordt berekend. Plaats het achter een view-aanroep wanneer slechts enkele taken het nodig hebben, omdat een bestand dat één keer wordt gelezen zijn tokens één keer kost in plaats van bij elke beurt. Het doorslaggevende getal is uw replay-aantal, en het usage-object geeft u dat getal direct.

Tellen geheugenfuncties mee voor de verbruikslimieten van mijn abonnement?

Ja, indirect, omdat verbruikslimieten worden verbruikt door de tokens die elk verzoek bevat. De helpdocumentatie van Anthropic stelt dat langere gesprekken die automatisch contextbeheer activeren, meer van uw verbruikslimiet opsnoepen. Geheugen maakt elk verzoek iets langer, en een lange sessie speelt die lengte bij elke beurt opnieuw af. Hoe de verbruikslimieten van Claude daadwerkelijk werken beschrijft wat wanneer wordt gereset.