Claude gebruikslimieten: wat te doen bij error
Ontdek het verschil tussen Claude abonnement limieten en API 429 rate limits. Leer waarom model wisselen niet helpt en hoe u de juiste oplossing vindt.
Wat zijn de gebruikslimieten van Claude?
De gebruikslimieten van Claude bestaan uit twee afzonderlijke systemen. De eerste stap is bepalen welk systeem de limiet heeft bereikt. Een Claude-abonnement (Pro, Max, Team, of Enterprise) biedt een rollend gebruiksaldo dat wordt gedeeld tussen verschillende modellen en Claude chat. U krijgt dan een melding zoals You've hit your session limit · resets 3:45pm. De Claude API meet iets anders: de snelheid waarmee u verzoeken en tokens verstuurt, gemeten per minuut. U krijgt dan een HTTP 429-fout van het type rate_limit_error met een retry-after header die aangeeft hoeveel seconden u moet wachten.
De oplossingen voor beide gevallen verschillen volledig. Een abonnementlimiet heeft betrekking op het totale verbruik binnen een bepaalde periode; u moet wachten tot de reset plaatsvindt of extra gebruik aanschaffen. Een API rate limit heeft betrekking op uw huidige snelheid; deze vervalt binnen enkele seconden zodra u de snelheid verlaagt.
De limieten voor abonnementen en de tiers voor rate limits veranderen vaak. Een onjuist getal is schadelijker dan geen getal, daarom worden er hier geen specifieke waarden vermeld. Gebruik de onderstaande commando's om uw eigen limieten te controleren.
Welke limiet heeft u bereikt? Lees de exacte foutmelding
Claude Code vermeldt het systeem in de tekst die wordt weergegeven. Controleer uw systeem voordat u wijzigingen aanbrengt.
You've hit your session limit · resets 3:45pmis een abonnementlimiet. De toegewezen hoeveelheid voor uw huidige periode is verbruikt.You've hit your weekly limit · resets Mon 12:00amis dezelfde limiet voor een langere periode.You've hit your Opus limit · resets 3:45pmis een abonnementlimiet die alleen geldt voor Opus-verzoeken. In dit specifieke geval helpt het wisselen van model.API Error: Request rejected (429) · this may be a temporary capacity issue. If it persists, check https://status.claude.com.is een API rate limit. U heeft de limiet bereikt die is ingesteld voor uw API key, of voor uw Amazon Bedrock of Google Cloud project.API Error: Server is temporarily limiting requests (not your usage limit)is een tijdelijke throttle die niet gerelateerd is aan uw abonnement. Claude Code probeert het automatisch opnieuw met backoff voordat deze melding wordt getoond.
Abonnementlimieten: sessie, wekelijks en het Opus-venster
Een abonnement bevat een voortschrijdend gebruiksalvo. Wanneer dit is uitgeput, blokkeert Claude Code verdere verzoeken totdat de resettijd in de melding wordt bereikt. Twee eigenschappen van dit salvo veroorzaken de meeste verwarring.
- Het wordt gedeeld met Claude chat. Werk op claude.ai verbruikt hetzelfde salvo als werk in de terminal. Intensief gebruik in de chat verkort dus de tijd voor coderen in de avond.
- Het wordt gedeeld tussen verschillende modellen. Sessie- en wekelijkse limieten hebben geen budget per model, met uitzondering van de Opus-limiet.
Bij Claude for Teams en Enterprise is de structuur een salvo per gebruiker. Dit wordt gereset binnen een voortschrijvend venster van vijf uur en een wekelijks venster. Het wordt gedeeld met Claude chat en Cowork. De omvang wordt bepaald door het pakket (Standard of Premium). Bij Pro en Max zijn de resettijd in de melding en uw eigen /usage balken de betrouwbare gegevens, niet gegevens uit een blogpost. Als u nog een pakket moet kiezen, vergelijkt welk Claude-abonnement u nodig heeft de beperkingen van elk pakket.
Waarom het wisselen van model met /model de toegang niet herstelt
Dit is de meest voorkomende fout. De documentatie is hierover duidelijk: sessie- en wekelijkse limieten worden gedeeld over alle modellen. Het wisselen van model herstelt de toegang dus niet. Het kiezen van een kleiner model nadat de sessieperiode is verstreken, verandert enkel welk model antwoordt. Het verandert de resterende limiet niet. De limiet is namelijk niet per model vastgelegd, waardoor het wisselen niets vrijmaakt.
De uitzondering is de Opus-limiet, een specifieke limiet voor dit model. Als de melding You've hit your Opus limit verschijnt, dan is /model de juiste oplossing. Wissel naar een ander model om door te werken, aangezien alleen verzoeken aan Opus werden geblokkeerd.
Het behandelen van de limiet als een bug is de tweede fout. Het opnieuw installeren of opnieuw authenticeren verandert niets. De limiet wordt hersteld wanneer de periode wordt gereset of wanneer u verbruikscredits aanschaft.
Wat te doen bij een abonnementlimiet
- Controleer de reset-tijd. Een sessievenster is kort. Een wekelijks venster vereist geen actie aan uw bureau.
- Bij de Opus-limiet voert u
/modeluit en kiest u een ander model. - Voer
/usageuit om uw limieten, uw quota en de reset-tijden te bekijken./costis een alias voor hetzelfde scherm. - Voer
/usage-creditsuit om door te werken na het bereiken van de limiet. Bij Pro en Max opent dit uw factureringsinstellingen. Bij Team en Enterprise opent dit de gebruikinstellingen van uw organisatie, of wordt er een verzoek naar uw admins gestuurd als u geen toegang heeft tot de facturering. - Als u elke week tegen dezelfde limiet aanloopt, is het huidige abonnement niet geschikt voor uw werkwijze.
/usage-credits vereist een claude.ai-abonnement via /login. Het is niet beschikbaar met API-key authenticatie, omdat een API-key geen abonnementlimiet heeft die uitgebreid kan worden.
Gebruikskredieten hebben één belangrijk neveneffect. De levensduur van de prompt cache is één uur bij een abonnement. Deze daalt naar vijf minuten zodra u kredieten gebruikt. Hierdoor starten meer interacties zonder cache, waardoor de Claude Code token usage stijgt bij dezelfde hoeveelheid werk.
Berichten die lijken op limieten voor gebruik maar dat niet zijn
Vier Claude Code-fouten worden gerapporteerd als limieten voor gebruik, maar dit zijn ze niet.
- Een context- of auto-compact-waarschuwing is geen limiet voor gebruik.
/contextprintt een regel zoalsContext exceeds the 200k-token limit by 94k tokens — run /compact or /clear to continue.zodra het gesprek de context window van het model heeft overschreden. De oudere geschiedenis wordt samengevat om ruimte vrij te maken; uw planlimiet blijft ongewijzigd. Error during compaction: Conversation too long. Press esc twice to go up a few messages and try again.betekent dat/compactzelf is mislukt, omdat er niet genoeg vrije context over is om de samenvatting te bevatten die het zou produceren.Credit balance is too lowbetekent dat uw Console-organisatie de vooraf betaalde credits is misgelopen. Voeg credits toe via platform.claude.com/settings/billing; hier is ook de optie voor automatisch opladen beschikbaar.API Error: Usage credits required for 1M context · run /usage-credits to turn them on, or /model to switch to standard contextis een controle van de bevoegdheid, geen uitgeput quotum. Kies de modelvariant zonder de[1m]suffix, of stelCLAUDE_CODE_DISABLE_1M_CONTEXT=1in.
Nog een fout komt van de API. Een 413 request_too_large is een groottebeperking voor een enkele request, geen rate limit.
API rate limits: wat de 429 precies telt
De Messages API meet drie zaken, afzonderlijk voor elke modelklasse.
- requests per minute (RPM)
- input tokens per minute (ITPM)
- output tokens per minute (OTPM)
Uw organisatie heeft ook een bestedingslimiet, wat iets anders is: een maximale maandelijkse kost voor API-gebruik. Zodra u het bestedingsplafond van uw tier bereikt, wordt het API-gebruik gepauzeerd tot de volgende maand, tenzij u een hogere limiet aanvraagt. Een retry loop lost dit niet op.
Vier mechanismen bepalen wanneer de 429 optreedt.
- Limieten gelden per modelklasse. Deze zijn afzonderlijk van toepassing op elk model. U kunt verschillende modellen tegelijkertijd gebruiken tot aan hun respectievelijke limieten. Sommige families delen een bucket: de Opus rate limit is een totaal voor Claude Opus 4.8, Opus 4.7, Opus 4.6 en Opus 4.5, terwijl Claude Sonnet 5 een eigen limiet heeft.
- Capaciteit wordt continu aangevuld. De API gebruikt een token bucket algorithm. De capaciteit wordt dus continu aangevuld in plaats van op een vast moment gereset. Een limiet van 60 requests per minute kan worden afgedwongen als één request per seconde. 60 requests die tegelijk worden verzonden, zullen dus nog steeds falen.
- Bij de meeste modellen telt alleen ongecachede input mee voor ITPM.
input_tokensencache_creation_input_tokenstellen mee.cache_read_input_tokenstelt niet mee voor de meeste Claude-modellen, met Claude Haiku 3.5 als gedocumenteerde uitzondering. Caching zorgt daarom voor extra ruimte binnen de rate limit en voor korting. Aan de outputzijde telt een hogemax_tokensniet mee voor OTPM, omdat OTPM alleen de daadwerkelijk geproduceerde tokens telt. - Limieten gelden op organisatieniveau. Een workspace kan een lagere limiet krijgen. De limieten voor de gehele organisatie zijn altijd van toepassing, zelfs als de limieten van workspaces samen een hoger totaal vormen. Een limiet die u niet op een workspace heeft overschreven, wordt overgenomen van de organisatie en is niet onbeperkt.
Tiers genaamd Start, Build, Scale en Custom bepalen de werkelijke getallen. Deze worden automatisch toegewezen op basis van uw gebruikshistorie en de status van uw account. Nieuwe organisaties kunnen onder de standaard gepubliceerde limieten starten, waardoor een eerste 429 eerder kan optreden dan een tabel voorspelt. Een plotselinge stijging in gebruik activeert versnellingslimieten. Deze geven een 429 terug terwijl u nog binnen uw tier zit. Verhoog het verkeer daarom geleidelijk. Elk gepubliceerd getal is een plafond: gedocumenteerde limieten zijn de maximaal toegestane limieten, geen gegarandeerde minima. Om meer capaciteit aan te vragen, gebruikt u de optie "Request rate limit increase" op de Limits pagina in de Claude Console.
Het lezen van een 429: retry-after, de headers en SDK retries
Elke API-fout geeft dezelfde envelop terug: een genest error object met het type en de boodschap, plus een request_id op topniveau.
{
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "<names the rate limit you exceeded>"
},
"request_id": "req_011CSHoEeqs5C35K2UUqR7Fy"
}De headers bevatten de rest van de informatie.
retry-afteris het aantal seconden dat u moet wachten voordat u de aanvraag opnieuw kunt proberen. Eerdere pogingen zullen falen.anthropic-ratelimit-requests-limit,anthropic-ratelimit-requests-remainingenanthropic-ratelimit-requests-resetbeschrijven uw request budget.anthropic-ratelimit-input-tokens-*enanthropic-ratelimit-output-tokens-*doen hetzelfde voor ITPM en OTPM, met dezelfde suffixes: limit, remaining en reset.anthropic-ratelimit-tokens-*toont de waarden voor de meest beperkende limiet die momenteel van toepassing is.
Reset headers zijn RFC 3339 timestamps. Remaining token headers zijn afgerond op de dichtstbijzijnde duizend; beschouw deze als een indicatie. Fast mode heeft een eigen pool en eigen anthropic-fast-* headers. Lees al deze headers uit elke succesvolle aanroep:
curl -s -D - -o /dev/null https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{"model":"claude-sonnet-5","max_tokens":16,"messages":[{"role":"user","content":"hi"}]}' \
| grep -i 'ratelimit\|retry-after\|request-id'Elke respons bevat ook een unieke request-id header, zoals req_018EeWyXxfu5pfWkrYcMdjWG. Deze verschijnt als request_id in error bodies en als _request_id in Python en TypeScript SDK responses. Vermeld deze waarde wanneer u contact opneemt met de supportafdeling.
Controleer of u überhaupt een backoff loop nodig heeft voordat u deze implementeert. De officiële SDKs proberen tijdelijke fouten automatisch opnieuw, inclusief verbindingsfouten, rate limits en 5xx server errors. Dit gebeurt met exponential backoff, standaard twee keer, waarbij de retry-after header wordt gerespecteerd indien aanwezig. Elke client accepteert een maximum-retries optie om dit gedrag te wijzigen of uit te schakelen.
import anthropic
client = anthropic.Anthropic(max_retries=5) # the SDK default is 2
try:
msg = client.messages.create(
model="claude-sonnet-5",
max_tokens=1024,
messages=[{"role": "user", "content": "hello"}],
)
except anthropic.RateLimitError as err:
headers = err.response.headers
print("still limited after retries; wait", headers.get("retry-after"), "seconds")
print("request id:", headers.get("request-id"))529 overloaded_error is niet uw schuld
Een 429 geeft aan dat u te snel bent. Een 529 overloaded_error betekent dat de API tijdelijk overbelast is. Dit gebeurt wanneer de API een hoge verkeersdruk ervaart bij alle gebruikers. Uw API-key of uw code is hier niet de oorzaak van. Gebruik exponential backoff bij een nieuwe poging; de SDK's doen dit al standaard bij 5xx-responses. Controleer status.claude.com als het probleem aanhoudt. Een 500 api_error is een interne fout die u op dezelfde manier opnieuw probeert. Geen van beide fouten is een rate limit.
Lees uw eigen limieten in plaats van een tabel
Bij een abonnement is /usage het relevante scherm. Hier ziet u de verbruiksbalken van uw plan en een specificatie van het verbruik. Met d of w schakelt u tussen de laatste 24 uur en de laatste 7 dagen. Er zijn twee kanttekeningen. Het Session-blok toont het verbruik van API-tokens en is bedoeld voor API-gebruikers; abonnees kunnen het bedrag in dollars negeren. De gegevens zijn gebaseerd op de lokale sessiegeschiedenis op die machine. Verbruik van andere apparaten of van claude.ai wordt niet getoond.
Aan de API-zijde toont de Usage-pagina in de Claude Console twee grafieken: "Rate Limit - Input Tokens" en "Rate Limit - Output Tokens". De input-grafiek zet het uurtarief van het maximale aantal uncached input-tokens per minuut af tegen uw huidige ITPM-limiet. Uw cache-percentage staat ernaast. Hierdoor ziet u een limiet naderen voordat u deze in productie bereikt.
Om uw geconfigureerde limieten programmatisch uit te lezen:
curl -s https://api.anthropic.com/v1/organizations/rate_limits \
-H "x-api-key: $ANTHROPIC_ADMIN_KEY" \
-H "anthropic-version: 2023-06-01"Hiervoor is een Admin API-key nodig. GET /v1/organizations/workspaces/{workspace_id}/rate_limits doet hetzelfde per workspace. Beide zijn read-only: gebruik het tabblad Limits in de Console om een limiet te wijzigen.
Gebruik less, zodat u minder limieten bereikt
Beide systemen meten hetzelfde, waardoor deze instellingen voor beide systemen gelden.
- Verbruik minder tokens per beurt. Continue sessies houden de cache warm. Het wisselen van
/cleartussen niet-gerelateerde taken kost niets. Claude Code tokenverbruik behandelt deze instellingen volledig. - Verlaag de inspanning. De niveaus zijn
low,medium,high,xhighenmax. Het/effort-menu biedt ookultracode, wat de kosten verhoogt in plaats van verlaagt. Diepgaande redenering voor een mechanische hernoeming is niet nodig. - Verminder concurrency na een 429. Verlaag
CLAUDE_CODE_MAX_TOOL_USE_CONCURRENCYen vermijd veel parallelle subagents. Gebruik ook/status: een foutieveANTHROPIC_API_KEYstuurt verzoeken via een laagwaardige sleutel in plaats van uw abonnement. - Verplaats niet-interactieve taken naar de Message Batches API. Deze verwerkt grote volumes asynchroon met 50% korting op input- en output-tokens. Dit gebeurt onder eigen rate limits, zodat een nachtelijke taak niet concurreert met uw sessie.
Werk met pieken die door een programma in plaats van een persoon wordt aangestuurd, hoort vanaf het begin via een API-sleutel te verlopen. Uw eerste Claude API app op een VPS behandelt het beheer van sleutels en retries. Een langdurige agent-sessie blijft behouden bij een verbroken verbinding wanneer u Claude Code draaiend houdt op een VPS binnen tmux gebruikt.
FAQ
Waarom lost het wisselen van modellen mijn Claude usage limit niet op?
Omdat sessie- en wekelijkse limieten gedeeld worden over alle modellen. Het quotum hoort bij het abonnement en niet bij een specifiek model. Hierdoor verandert /model welk model antwoordt, maar niet hoeveel quotum er nog over is. De enige uitzondering is You've hit your Opus limit, wat alleen geldt voor Opus-verzoeken. In dat geval is het wisselen van model de gedocumenteerde oplossing.
Wat betekent de 429 rate_limit_error en hoe lang moet ik wachten?
Dit betekent dat uw account een limiet heeft bereikt voor die specifieke modelklasse: verzoeken per minuut, input tokens per minuut, of output tokens per minuut. De respons bevat een retry-after header met het aantal seconden dat u moet wachten; eerdere pogingen zullen falen. De officiële SDK's voeren standaard twee keer een retry uit met exponential backoff voor rate limits en 5xx errors, waarbij de header wordt gerespecteerd. Een 429-fout die optreedt terwijl u nog binnen de limieten van uw tier valt, wijst op een versnellingslimiet door een plotselinge piek in het gebruik.
Hoe zie ik mijn Claude usage limits en wanneer deze worden gereset?
Voer in Claude Code /usage uit voor de balken van uw plan, reset-tijden en een overzicht van het verbruik; /cost is een alias, en d of w schakelt tussen de laatste 24 uur en de laatste 7 dagen. Deze gegevens komen uit de lokale sessiegeschiedenis, dus ze bevatten geen verbruik van andere apparaten of van claude.ai. Via de API toont de Console uw rate limits, en GET /v1/organizations/rate_limits geeft uw geconfigureerde limieten terug met een Admin API key.
Kan ik doorwerken nadat ik mijn Claude plan limit heb bereikt?
Soms. Voer /usage-credits uit om extra verbruik te kopen boven de limiet op Pro en Max, of om dit aan te vragen bij een admin op Team en Enterprise; dit vereist een claude.ai login via /login en is niet beschikbaar bij authenticatie met een API key. Wacht anders tot de reset-tijd, wissel van model als het de Opus-limiet betrof, of verplaats het werk naar een API key, die per minuut meet in plaats van per venster.