SSD Nodes Learn
Guides Matt ConnorPar Matt Connor · Mis à jour le 2026-07-24

limites utilisation Claude chat vs API

Comprenez la différence entre les quotas d'abonnement et l'erreur HTTP 429 de l'API. Apprenez pourquoi changer de modèle ne réinitialise pas votre accès.

Quelles sont les limites d'utilisation de Claude ?

Les limites d'utilisation de Claude reposent sur deux systèmes distincts. Votre première tâche consiste à identifier celui qui a bloqué votre accès. Un abonnement Claude (Pro, Max, Team ou Enterprise) vous offre un quota d'utilisation glissant partagé entre les modèles et Claude chat ; l'accès est alors interrompu avec un message du type You've hit your session limit · resets 3:45pm. L'API Claude mesure un paramètre différent : la vitesse d'envoi des requêtes et des tokens, calculée par minute. L'accès est alors interrompu par une erreur HTTP 429 de type rate_limit_error et un header retry-after indiquant le nombre de secondes à attendre.

Les solutions de résolution sont totalement différentes. Une limite d'abonnement dépend de votre consommation sur une période donnée ; vous devez donc attendre la réinitialisation ou acheter plus de capacité. Une limite de rate-limit d'API dépend de votre vitesse actuelle ; elle est levée en quelques secondes dès que vous ralentissez.

Les quotas des plans et les niveaux de rate-limit changent fréquemment. Une valeur erronée est plus préjudiciable que l'absence de valeur, c'est pourquoi aucune n'est affichée ici. Consultez vos propres valeurs avec les commandes présentées plus bas.

Quel limite avez-vous atteinte ? Lisez le message exact

Claude Code nomme le système dans le texte affiché. Identifiez le vôtre avant de modifier quoi que ce soit.

  • You've hit your session limit · resets 3:45pm est une limite d'abonnement. Le quota glissant de votre forfait pour cette période est épuisé.
  • You've hit your weekly limit · resets Mon 12:00am est le même système sur une période plus longue.
  • You've hit your Opus limit · resets 3:45pm est une limite d'abonnement qui s'applique uniquement aux requêtes Opus. C'est le seul cas où changer de modèle est utile.
  • API Error: Request rejected (429) · this may be a temporary capacity issue. If it persists, check https://status.claude.com. est une limite de taux (rate limit) de l'API. Vous avez atteint la limite configurée pour votre clé API, ou pour votre projet Amazon Bedrock ou Google Cloud.
  • API Error: Server is temporarily limiting requests (not your usage limit) est un throttle de courte durée sans rapport avec le quota de votre forfait. Claude Code effectue automatiquement des tentatives avec backoff avant d'afficher cette ligne.

Limites d'abonnement : session, hebdomadaire et fenêtre Opus

Un plan d'abonnement inclut un quota d'utilisation glissant. Une fois épuisé, Claude Code bloque les requêtes jusqu'à l'heure de réinitialisation indiquée dans le message. Deux propriétés de ce quota causent la plupart des erreurs de compréhension.

  • Le quota est partagé avec le chat Claude. Votre travail sur claude.ai utilise le même quota que votre travail dans le terminal. Une utilisation intensive du chat l'après-midi réduit votre temps de codage en soirée.
  • Le quota est partagé entre les modèles. Les limites de session et hebdomadaires n'ont pas de budget par modèle, à l'exception unique de la limite Opus.

Pour Claude for Teams et Enterprise, le fonctionnement documenté est un quota par utilisateur. Ce quota se réinitialise sur une fenêtre glissante de cinq heures et une fenêtre hebdomadaire. Il est partagé avec Claude chat et Cowork, et sa taille dépend du niveau de l'utilisateur (Standard ou Premium). Pour les plans Pro et Max, l'heure de réinitialisation affichée dans le message et vos propres barres /usage sont les seules valeurs fiables, pas un chiffre copié d'un article de blog. Si vous hésitez encore sur le niveau à choisir, quel plan Claude vous faut compare les restrictions de chaque offre.

Pourquoi le changement de modèle via /model ne restaure pas l'accès

C'est l'erreur la plus fréquente, et la documentation est claire : les limites de session et hebdomadaires sont partagées entre tous les modèles. Changer de modèle ne restaure donc pas l'accès. Choisir un modèle plus petit après l'épuisement de votre fenêtre de session change uniquement le modèle qui répondra. Cela ne modifie pas le quota restant, car le quota n'est pas lié à un modèle spécifique ; le changement n'a donc rien à libérer.

L'exception est la limite Opus, qui est un plafond réellement spécifique au modèle. Si le message affiche You've hit your Opus limit, alors /model est la solution correcte. Passez à un autre modèle pour continuer à travailler, car seules les requêtes Opus sont bloquées.

Considérer la limite comme un bug est la deuxième erreur. Réinstaller ou se réauthentifier ne change rien. Le quota est rétabli lors de la réinitialisation de la fenêtre, ou lors de l'achat de crédits d'utilisation.

Que faire en cas de limite d'abonnement

  1. Consultez l'heure de réinitialisation. Une fenêtre de session est courte. Une fenêtre hebdomadaire ne nécessite pas de rester devant votre écran.
  2. S'il s'agit de la limite Opus, lancez /model et choisissez un autre modèle.
  3. Lancez /usage pour voir les limites de votre plan, vos quotas et la date de réinitialisation. /cost est un alias pour le même écran.
  4. Lancez /usage-credits pour continuer à travailler au-delà du plafond. Sur Pro et Max, cela ouvre vos paramètres de facturation. Sur Team et Enterprise, cela ouvre les paramètres d'utilisation de votre organisation, ou envoie une requête à vos admins si vous n'avez pas d'accès à la facturation.
  5. Si vous atteignez la même limite chaque semaine, votre plan n'est pas adapté à votre flux de travail.

/usage-credits nécessite un abonnement claude.ai connecté via /login. Il est indisponible avec une authentification par clé API, car une clé API n'a pas de quota de plan à étendre.

Les crédits d'utilisation ont un effet secondaire important à connaître. La durée de vie du prompt cache est d'une heure avec un abonnement et tombe à cinq minutes dès que vous utilisez des crédits ; ainsi, plus de tours commencent à froid et l'utilisation des tokens Claude Code augmente pour un travail identique.

The messages that look like usage limits and are not

Four Claude Code errors get reported as usage limits and are none of them.

  • A context or auto-compact warning is not a usage limit. /context prints a line such as Context exceeds the 200k-token limit by 94k tokens — run /compact or /clear to continue. once the conversation has grown past the model's context window. Older history is summarized to free space, and your plan allowance is untouched.
  • Error during compaction: Conversation too long. Press esc twice to go up a few messages and try again. means /compact itself failed, because there is not enough free context left to hold the summary it would produce.
  • Credit balance is too low means your Console organization has run out of prepaid credits. Add credits at platform.claude.com/settings/billing, which also offers auto-reload.
  • API Error: Usage credits required for 1M context · run /usage-credits to turn them on, or /model to switch to standard context is an entitlement check, not an exhausted quota. Pick the model variant without the [1m] suffix, or set CLAUDE_CODE_DISABLE_1M_CONTEXT=1.

One more comes from the API. A 413 request_too_large is a size limit on a single request, not a rate limit.

Limites de taux de l'API : ce que compte réellement l'erreur 429

L'API Messages mesure trois éléments, séparément pour chaque classe de modèle.

  • requêtes par minute (RPM)
  • tokens d'entrée par minute (ITPM)
  • tokens de sortie par minute (OTPM)

Votre organisation possède également une limite de dépenses, ce qui est différent : un coût mensuel maximum pour l'utilisation de l'API. Une fois le plafond de votre tier atteint, l'utilisation de l'API est suspendue jusqu'au mois suivant, sauf si vous demandez une limite supérieure. Aucune boucle de retry ne peut résoudre ce problème.

Quatre mécanismes déterminent l'apparition de l'erreur 429.

  • Les limites s'appliquent par classe de modèle. Elles s'appliquent séparément à chaque modèle. Vous pouvez donc utiliser différents modèles jusqu'à leurs limites respectives simultanément. Certaines familles partagent un quota : la limite de taux pour Opus est un total cumulé pour Claude Opus 4.8, Opus 4.7, Opus 4.6 et Opus 4.5, tandis que Claude Sonnet 5 possède la sienne.
  • Le remplissage de la capacité est continu. L'API utilise un algorithme de token bucket. La capacité se reconstitue en continu au lieu de se réinitialiser à un moment fixe. Une limite de 60 requêtes par minute peut s'appliquer comme une requête par seconde ; ainsi, 60 requêtes envoyées d'un coup échoueront toujours.
  • Seuls les inputs non mis en cache comptent pour l'ITPM sur la plupart des modèles. input_tokens et cache_creation_input_tokens sont comptabilisés. cache_read_input_tokens ne l'est pas sur la plupart des modèles Claude, à l'exception documentée de Claude Haiku 3.5. Le caching permet donc de gagner de la marge sur les limites de taux en plus d'offrir une réduction. Pour la sortie, un max_tokens élevé ne compte pas dans l'OTPM, car l'OTPM ne compte que les tokens réellement produits.
  • Les limites s'appliquent au niveau de l'organisation. Un workspace peut recevoir une limite inférieure, et les limites de l'organisation s'appliquent toujours même si la somme des limites des workspaces est supérieure. Une limite que vous n'avez pas modifiée sur un workspace est héritée de l'organisation, elle n'est pas illimitée.

Les tiers nommés Start, Build, Scale et Custom définissent les chiffres réels, attribués automatiquement selon votre historique d'utilisation et l'état de votre compte. Les nouvelles organisations peuvent commencer avec des limites inférieures aux limites standards publiées ; une première erreur 429 peut donc survenir plus tôt que ce qu'un tableau prévoit. Une augmentation brutale de l'utilisation déclenche les limites d'accélération, qui renvoient une erreur 429 alors que vous êtes encore dans votre tier. Augmentez votre trafic progressivement. Chaque chiffre publié est un plafond : les limites documentées sont des utilisations maximales autorisées, pas des minimums garantis. Pour demander davantage, utilisez le contrôle "Request rate limit increase" sur la page Limits de la Claude Console.

Lecture d'une erreur 429 : retry-after, les headers et les retries des SDK

Chaque erreur API retourne la même enveloppe : un objet error imbriqué contenant le type et le message, plus un request_id de premier niveau.

{
  "type": "error",
  "error": {
    "type": "rate_limit_error",
    "message": "<names the rate limit you exceeded>"
  },
  "request_id": "req_011CSHoEeqs5C35K2UUqR7Fy"
}

Les headers contiennent le reste des informations.

  • retry-after est le nombre de secondes à attendre avant de pouvoir retenter la requête. Les tentatives anticipées échoueront.
  • anthropic-ratelimit-requests-limit, anthropic-ratelimit-requests-remaining et anthropic-ratelimit-requests-reset décrivent votre budget de requêtes.
  • anthropic-ratelimit-input-tokens-* et anthropic-ratelimit-output-tokens-* font la même chose pour l'ITPM et l'OTPM, avec les mêmes suffixes remaining et reset.
  • anthropic-ratelimit-tokens-* affiche les valeurs pour la limite la plus restrictive actuellement en vigueur.

Les headers de reset sont des timestamps au format RFC 3339. Les headers de tokens restants sont arrondis au millier le plus proche ; lisez-les comme une estimation. Le mode Fast possède son propre pool et ses propres headers anthropic-fast-*. Lisez-les tous lors de chaque appel réussi :

curl -s -D - -o /dev/null https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{"model":"claude-sonnet-5","max_tokens":16,"messages":[{"role":"user","content":"hi"}]}' \
  | grep -i 'ratelimit\|retry-after\|request-id'

Chaque réponse contient également un header request-id unique, tel que req_018EeWyXxfu5pfWkrYcMdjWG. Il apparaît sous la forme request_id dans les corps d'erreur et sous la forme _request_id dans les réponses des SDK Python et TypeScript. Citez-le lorsque vous contactez le support.

Vérifiez si vous avez réellement besoin d'implémenter une boucle de backoff avant de l'écrire. Les SDK officiels gèrent automatiquement les retries pour les erreurs transitoires, incluant les erreurs de connexion, les rate limits et les erreurs serveur 5xx, avec un exponential backoff. Par défaut, deux tentatives sont effectuées en respectant le header retry-after s'il est présent. Chaque client accepte une option maximum-retries pour modifier ou désactiver ce comportement.

import anthropic

client = anthropic.Anthropic(max_retries=5)  # the SDK default is 2

try:
    msg = client.messages.create(
        model="claude-sonnet-5",
        max_tokens=1024,
        messages=[{"role": "user", "content": "hello"}],
    )
except anthropic.RateLimitError as err:
    headers = err.response.headers
    print("still limited after retries; wait", headers.get("retry-after"), "seconds")
    print("request id:", headers.get("request-id"))

L'erreur 529 overloaded_error ne vous est pas imputable

Une erreur 429 signifie que vous avez effectué trop de requêtes. Une erreur 529 overloaded_error indique que l'API est temporairement surchargée. Cela arrive lorsque l'API subit un trafic élevé de la part de l'ensemble des utilisateurs. Votre clé ou votre code n'est pas en cause. Réessayez en utilisant un exponential backoff, ce que les SDK font déjà pour les réponses 5xx, et consultez status.claude.com si le problème persiste. Une erreur 500 api_error est une erreur interne que vous devez traiter de la même manière ; aucune de ces deux erreurs n'est un rate limit.

Consultez vos propres limites au lieu d'un tableau

Pour un abonnement, /usage est l'écran principal. Il affiche les barres d'utilisation de votre forfait et le détail de la consommation. Les commutateurs d ou w permettent de basculer entre les dernières 24 heures et les 7 derniers jours. Deux points d'attention. Le bloc Session affiche l'utilisation des tokens API ; il est destiné aux utilisateurs de l'API, les abonnés peuvent donc ignorer le montant en dollars. Les chiffres proviennent de l'historique des sessions locales sur cette machine ; l'utilisation provenant d'un autre appareil ou de claude.ai n'est pas incluse.

Côté API, la page Usage de la Claude Console affiche deux graphiques : "Rate Limit - Input Tokens" et "Rate Limit - Output Tokens". Le graphique d'entrée trace le maximum horaire de tokens d'entrée non mis en cache par minute par rapport à votre limite ITPM actuelle. Votre taux de cache est affiché à côté, ce qui permet de surveiller l'approche d'une limite avant qu'elle ne soit atteinte en production.

Pour lire vos limites configurées par programmation :

curl -s https://api.anthropic.com/v1/organizations/rate_limits \
  -H "x-api-key: $ANTHROPIC_ADMIN_KEY" \
  -H "anthropic-version: 2023-06-01"

Une clé Admin API est nécessaire, et GET /v1/organizations/workspaces/{workspace_id}/rate_limits effectue la même opération par workspace. Les deux sont en lecture seule : pour modifier une limite, utilisez l'onglet Limits dans la Console.

Utiliser less pour respecter davantage les limites

Les deux systèmes mesurent la même chose en arrière-plan, donc ces leviers s'appliquent aux deux.

  • Dépensez moins de tokens par tour. Les sessions continues maintiennent le cache actif, et le /clear entre des tâches sans rapport ne coûte rien. L'utilisation des tokens par Claude Code détaille ces leviers.
  • Réduisez l'effort. Les niveaux sont low, medium, high, xhigh et max. Le menu /effort propose aussi ultracode, qui augmente la dépense au lieu de la réduire. Un raisonnement profond pour un simple renommage mécanique est inutile.
  • Réduisez la concurrence après une erreur 429. Baissez le CLAUDE_CODE_MAX_TOOL_USE_CONCURRENCY et évitez d'utiliser de nombreux sous-agents en parallèle. Utilisez aussi /status : un ANTHROPIC_API_KEY parasite redirige les requêtes via une clé de bas niveau au lieu de votre abonnement.
  • Transférez le travail non interactif vers l'API Message Batches. Elle traite de gros volumes de manière asynchrone avec une réduction de 50 % sur les tokens d'entrée et de sortie, sous ses propres rate limits. Ainsi, un job nocturne n'entre pas en compétition avec votre session.

Le travail par pics généré par un programme plutôt que par une personne doit utiliser une clé API dès le départ. Votre première application Claude API sur un VPS traite de la gestion des clés et des retries. Un agent tournant longtemps survivra à une déconnexion si vous maintenez Claude Code en cours sur un VPS dans tmux.

FAQ

Pourquoi le changement de modèle ne résout-il pas ma limite d'utilisation Claude ?

Les limites de session et hebdomadaires sont partagées entre tous les modèles. Le quota appartient au plan et non au modèle ; ainsi, /model change le modèle utilisé mais pas le quota restant. La seule exception est You've hit your Opus limit, qui s'applique uniquement aux requêtes Opus. Dans ce cas, changer de modèle est la solution documentée.

Que signifie l'erreur 429 rate_limit_error, et combien de temps dois-je attendre ?

Cela signifie que votre compte a atteint une limite de débit pour cette classe de modèles : requêtes par minute, tokens d'entrée par minute, ou tokens de sortie par minute. La réponse contient un header retry-after indiquant le nombre de secondes à attendre ; les tentatives précédentes échouent. Les SDK officiels gèrent déjà les retries pour les rate limits et les erreurs 5xx avec un exponential backoff, deux fois par défaut, en respectant ce header. Une erreur 429 qui survient alors que vous êtes encore dans les limites de votre tier indique une limite d'accélération due à une montée en charge soudaine.

Comment voir mes limites d'utilisation Claude et leur date de réinitialisation ?

Dans Claude Code, lancez /usage pour voir vos barres de quota, les heures de réinitialisation et le détail de l'utilisation ; /cost est un alias, et d ou w permet de basculer entre les dernières 24 heures et les 7 derniers jours. Ces chiffres proviennent de l'historique local de la session ; ils ne prennent donc pas en compte l'utilisation sur d'autres appareils ou sur claude.ai. Sur l'API, la Console affiche vos rate limits, et GET /v1/organizations/rate_limits renvoie vos limites configurées avec une clé Admin API.

Puis-je continuer à travailler après avoir atteint la limite de mon plan Claude ?

Parfois. Utilisez /usage-credits pour acheter du quota supplémentaire sur les plans Pro et Max, ou pour en faire la demande à un administrateur sur les plans Team et Enterprise ; cela nécessite une connexion claude.ai via /login et n'est pas disponible avec une authentification par clé API. Sinon, attendez l'heure de réinitialisation, changez de modèle s'il s'agissait de la limite Opus, ou transférez le travail vers une clé API, qui limite par minute plutôt que par fenêtre temporelle.