SSD Nodes Learn
Guides Matt ConnorPar Matt Connor · Mis à jour le 2026-07-24

Quel modèle Claude choisir ? Guide des prix

Comparez les tarifs de Claude Opus 4.8, Sonnet 5 et Haiku 4.5. Découvrez le coût réel pour 100 000 jobs et les paramètres qui impactent votre facture API.

Quel modèle Claude dois-je utiliser ?

La réponse courte est la suivante : commencez par Claude Opus 4.8. Ne changez de modèle que si vous avez une raison précise. Anthropic recommande la même approche. « Si vous hésitez sur le modèle à utiliser, commencez par Claude Opus 4.8 pour le codage agentique complexe et les travaux d'entreprise. » Passez à Claude Sonnet 5 lorsque la tâche est bien spécifiée et que vous l'exécutez plusieurs fois par jour. Passez ensuite à Claude Haiku 4.5 pour les tâches mécaniques à haut volume où vous connaissez déjà le résultat attendu. Claude Fable 5 est le modèle le plus performant pour les agents à exécution longue.

Ce choix a un coût. Voici les tarifs de l'API Claude au 23 juillet 2026, par million de tokens (noté MTok dans la documentation).

  • Claude Fable 5 (claude-fable-5) : 10 $ / MTok en entrée, 50 $ / MTok en sortie. 1M de contexte.
  • Claude Opus 4.8 (claude-opus-4-8) : 5 $ en entrée, 25 $ en sortie. 1M de contexte.
  • Claude Opus 4.7 (claude-opus-4-7) : 5 $ en entrée, 25 $ en sortie. 1M de contexte.
  • Claude Sonnet 5 (claude-sonnet-5) : 2 $ en entrée, 10 $ en sortie avec le tarif de lancement jusqu'au 31 août 2026. Le tarif standard de 3 $ en entrée et 15 $ en sortie s'appliquera le 1er septembre 2026. 1M de contexte.
  • Claude Haiku 4.5 (claude-haiku-4-5) : 1 $ en entrée, 5 $ en sortie. 200K de contexte.

Ces identifiants sont complets tels qu'écrits. Aucun élément ne leur est ajouté.

La taille de la requête n'entraîne pas de surcoût sur les modèles de 1M de tokens : « Une requête de 900k tokens est facturée au même tarif par token qu'une requête de 9k tokens. »

L'utilité réelle de chaque modèle

Anthropic décrit chaque modèle en une seule phrase, et ces descriptions sont plus fiables que n'importe quel leaderboard.

  • Claude Fable 5 : « Intelligence de nouvelle génération pour les agents à exécution longue. » Il est le plus lent des quatre en termes de latence.
  • Claude Opus 4.8 : « Pour le codage agentique complexe et les besoins en entreprise. » Latence modérée.
  • Claude Sonnet 5 : « Le meilleur équilibre entre vitesse et intelligence. » Rapide.
  • Claude Haiku 4.5 : « Le modèle le plus rapide avec une intelligence proche du frontier. »

Le modèle Haiku 4.5 possède également des limites qui déterminent son usage avant même le prix. Sa fenêtre de contexte est de 200K tokens au lieu de 1M ; un dépôt volumineux ou une transcription d'agent longue ne pourront pas être traités. Son output maximum sur l'API Messages synchrone est de 64K tokens contre 128K pour les autres. Enfin, sa date de cutoff de connaissances est février 2025, alors que les trois autres modèles sont à janvier 2026.

Quel est le coût de ce choix sur une charge de travail réelle ?

Chaque modèle de la gamme facture la sortie à cinq fois le prix de l'entrée. Opus 4.8 coûte 5 $ en entrée et 25 $ en sortie. Haiku 4.5 coûte 1 $ en entrée et 5 $ en sortie. Ce ratio est constant sur toute la gamme ; le choix du modèle est donc crucial pour les tâches générant beaucoup de sortie.

Le travail agentique est de ce type, car les tokens de réflexion sont facturés comme des tokens de sortie et comptent pour max_tokens même si le texte ne vous est jamais transmis. Sur Fable 5, Opus 4.8, Opus 4.7 et Sonnet 5, le résumé de réflexion est omis par défaut, donc le champ thinking est vide. La facturation reste identique : « Dans les deux cas, le bloc est facturé de la même manière et renvoyé de la même manière dans les conversations multi-tours. » Ce qui remplit réellement une facture Claude analyse ce mécanisme en détail.

L'activation de la réflexion varie selon les modèles comparés, ce qui faussera vos tests de coût si vous l'oubliez. Sur Sonnet 5 et Fable 5, la réflexion est déjà activée et ne nécessite aucune configuration. Sur Opus 4.8 et Opus 4.7, elle est désactivée jusqu'à ce que vous configuriez thinking: {type: "adaptive"} dans la requête. Harmonisez la configuration des deux côtés avant d'analyser les chiffres.

Pourquoi le modèle le moins cher peut être le plus coûteux

Prenez une tâche de codage isolée. La requête contient 60 000 tokens de contexte, et le modèle génère 8 000 tokens de sortie incluant le thinking. Sans caching, le calcul reste visible.

Sur Opus 4.8 : 0,06 MTok d'input à 5 $ équivaut à 0,30 $, et 0,008 MTok d'output à 25 $ équivaut à 0,20 $. La tentative coûte 0,50 $. Sur Haiku 4.5, la même tentative coûte 0,06 $ plus 0,04 $, soit 0,10 $.

Haiku est cinq fois moins cher par tentative, ce qui semble offrir une marge importante jusqu'à ce que vous analysiez l'impact d'une tentative échouée. Vous lisez une réponse incorrecte, ce qui vous fait perdre du temps. Vous la renvoyez comme contexte lors de la nouvelle tentative, donc chaque tentative est plus volumineuse que la précédente. Et quand la troisième tentative échoue encore, vous passez au modèle supérieur : 0,30 $ de Haiku plus 0,50 $ d'Opus équivaut à 0,80 $, soit 60 % de plus que l'exécution d'un seul Opus.

La question décisive est donc de savoir à quel coût vous pouvez vérifier la réponse. Lorsqu'une réponse erronée est évidente en une seconde, le petit modèle est rentable. Lorsqu'identifier l'erreur nécessite de lire attentivement un diff, le petit modèle vous coûte du temps qui n'apparaît jamais sur la facture.

Quand un modèle plus petit est plus efficace

Haiku 4.5 est le meilleur choix dans ces cas :

  • Tâches mécaniques d'un subagent. Un subagent qui renomme des fichiers ou collecte des résultats de recherche n'a pas besoin de raisonnement complexe. C'est le schéma standard une fois que vous avez construit un agent IA avec Claude et lui avez donné des helpers.
  • Triage de logs. Déterminer si une ligne est un bruit ou nécessite l'attention d'un humain est un jugement restreint avec un mode d'échec évident.
  • Classification par rapport à un ensemble de labels fixes. La sortie est courte et la précision est mesurable sur un échantillon.
  • Appels de production à haut volume. À 100 000 exécutions par jour, l'écart de coût par token n'est plus négligeable. C'est le cas habituel des workflows IA intégrés à n8n.
  • Tout cas où la vitesse de réponse est importante pour l'utilisateur. Haiku 4.5 est le modèle le plus rapide de la gamme.

Une limite est spécifique à Haiku. Son prompt minimum pour le cache est de 4 096 tokens, contre 1 024 sur Opus 4.8 et Sonnet 5. En dessous de ce minimum, « toute requête pour moins de ce nombre de tokens sera traitée sans mise en cache, et aucune erreur ne sera renvoyée ». Un bloc d'instructions de 1 500 tokens qui est mis en cache sur Sonnet 5 ne sera pas mis en cache sur Haiku 4.5. L'indice est que cache_creation_input_tokens et cache_read_input_tokens sont tous deux à zéro, ce qui permet de réduire les coûts d'un agent toujours actif au même titre que les autres causes de perte de cache.

Les leviers qui modifient la réponse

Chacun de ces paramètres influence davantage la facture que le nom du modèle lui-même.

Effort. output_config.effort contrôle la quantité de travail effectuée par le modèle avant de répondre. Les niveaux sont low, medium, high, xhigh et max, et high est la valeur par défaut : "Régler effort sur high produit exactement le même comportement qu'en omettant totalement le paramètre effort." Ce paramètre est imbriqué dans output_config au lieu de se situer au niveau supérieur de la requête :

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    messages=messages,
)

L'effort impacte chaque token de la réponse : "Il peut affecter toute la consommation de tokens, y compris les tool calls. Par exemple, un effort plus faible signifie que Claude effectue moins de tool calls." Cela s'additionne dans une boucle agentique. Ce n'est pas une limite de tokens : "L'effort est un signal comportemental, pas un budget de tokens strict." Anthropic ne publie aucun multiplicateur de coût par niveau et vous conseille de tester votre propre cas d'usage ; ainsi, une exécution de Sonnet 5 à high comparée à une exécution d'Opus 4.8 à low est une comparaison réelle que vous pouvez effectuer dès cet après-midi. Haiku 4.5 ne figure pas dans la liste des modèles supportant l'effort.

Prompt caching. Une lecture de cache coûte 0,1x le tarif d'entrée de base. Le nombre qui détermine le choix d'un modèle est l'impact de ce paramètre sur les différents tiers. Un cache hit sur Opus 4.8 coûte 0,50 $ / MTok, tandis qu'une entrée non mise en cache sur Haiku 4.5 coûte 1 $ / MTok. Un préfixe Opus bien mis en cache est donc moins cher par token d'entrée qu'un prompt Haiku non mis en cache. La gestion du cache est plus importante que le choix du modèle pour toute charge de travail renvoyant un large préfixe stable.

Batches. Si la réponse n'est pas urgente, l'API Message Batches exécute les mêmes modèles avec "une réduction de 50 % sur les tokens d'entrée et de sortie". Cela divise par deux chaque ligne du comparatif ci-dessous, et cela s'applique à tous les tiers : un job Opus 4.8 en batch coûte moins cher qu'un job Sonnet 5 synchrone au tarif standard à partir du 1er septembre 2026, échangeant la latence contre la capacité pour un coût identique.

Comparaison des coûts pour une charge de travail

La charge de travail : classer 100 000 e-mails de support. Chaque appel utilise 2 000 tokens d'entrée et 300 tokens de sortie. Cela représente 200 MTok d'entrée et 30 MTok de sortie.

  • Haiku 4.5 : 200 x 1 $ = 200 $ en entrée, 30 x 5 $ = 150 $ en sortie. Total 350 $.
  • Sonnet 5, tarif de lancement : 200 x 2 $ = 400 $ en entrée, 30 x 10 $ = 300 $ en sortie. Total 700 $.
  • Sonnet 5, dès le 1er septembre 2026 : 200 x 3 $ = 600 $ en entrée, 30 x 15 $ = 450 $ en sortie. Total 1 050 $.
  • Opus 4.8 : 200 x 5 $ = 1 000 $ en entrée, 30 x 25 $ = 750 $ en sortie. Total 1 750 $.

Modifiez quatre chiffres pour recalculer avec les tarifs de demain. Les ajustements ci-dessous modifient le résultat plus fortement que le nom du modèle :

  • Le Batching divise le coût par deux sur chaque ligne : 175 $, 350 $, 525 $ et 875 $. Une exécution nocturne de classification n'implique aucune attente, il est donc inutile de l'ignorer.
  • Le Caching du préfixe partagé. Supposons que 1 200 des 2 000 tokens d'entrée soient le même bloc d'instructions à chaque fois. Sur Sonnet 5 au tarif de lancement, ces tokens coûtent 0,20 $ / MTok en tant que cache hits au lieu de 2 $ / MTok. Ainsi, 120 MTok coûtent 24 $ au lieu de 240 $. Ajoutez 80 MTok d'entrée brute à 2 $, soit 160 $, plus 300 $ de sortie. Le coût de Sonnet 5 descend à environ 484 $ au lieu de 700 $. Cette méthode est inefficace sur Haiku 4.5, car 1 200 tokens est inférieur à son minimum de 4 096 tokens.
  • Les Retries. Supposons que vous rejetiez la réponse de Haiku pour 8 % des e-mails et que vous relanciez ces appels sur Opus 4.8. Ajoutez 0,08 x 1 750 $ = 140 $ aux 350 $, soit un total de 490 $. Calculez votre propre taux de rejet au lieu d'utiliser le mien.
  • Les Tool definitions, si le job les utilise. Le system prompt généré fait 290 tokens sur Opus 4.8 avec tool_choice réglé sur auto, 354 sur Sonnet 5 et 496 sur Haiku 4.5. Le modèle le moins cher présente la charge fixe la plus élevée.

Haiku avec un plan d'escalade à 490 $ et Sonnet 5 avec cache à 484 $ coûtent la même chose, alors que l'un d'eux effectue la tâche en un seul passage. Le modèle n'était pas la seule variable.

Changer de modèle en cours de session permet-il d'économiser de l'argent ?

C'est moins fréquent que ne le suggèrent les prix affichés, car l'économie se calcule par token et vous risquez de perdre tout un préfixe mis en cache.

Anthropic documente les éléments qui invalident un cache. Les préfixes sont construits dans l'ordre tools, puis system, puis messages, et « toute modification à un niveau invalide ce niveau ainsi que tous les niveaux suivants ». Deux paramètres de requête figurent aussi dans cette liste : « la configuration de réflexion (thinking configuration) et le niveau effort résolu sont intégrés directement dans le prompt, donc toute modification de l'un d'eux initialise un nouveau préfixe de cache ». La documentation va plus loin concernant l'effort : « variez l'effort selon les workloads plutôt qu'au sein d'une conversation qui dépend des cache hits ».

Le modèle ne figure pas dans cette liste documentée, ne faites donc aucune supposition. Consultez cache_read_input_tokens lors de la première requête après un changement et analysez le résultat. Sur un préfixe Opus de 150 000 tokens, une lecture de cache coûte environ 0,08 $ et une nouvelle écriture environ 0,94 $, ce qui est supérieur à l'économie réalisée sur plusieurs tours avec l'écart de prix par token.

Modifiez donc ces paramètres entre deux tâches, et non au sein d'une même tâche. Dans Claude Code, cela signifie faire /clear en premier, puisque le cache est de toute façon supprimé, puis /model ou /effort.

Comment tester la réponse sur votre propre charge de travail

Ne dimensionnez pas un prompt avec un compte provenant d'un autre modèle. L'endpoint de comptage de tokens est gratuit et utilise le tokenizer du modèle spécifié ; nommez donc le modèle que vous comptez appeler. Opus 4.7 et versions ultérieures, Fable 5 et Sonnet 5 utilisent un tokenizer plus récent qui « produit environ 30 % de tokens en plus pour le même texte ». Un budget calculé sur un ancien modèle sera donc sous-estimé sur un modèle récent, même avec un tarif par token inchangé.

Ensuite, analysez le résultat. input_tokens représente uniquement le reste non mis en cache ; la taille réelle du prompt est donc la somme de ce champ, de cache_creation_input_tokens et de cache_read_input_tokens. Une première application Claude API sur un VPS est l'endroit le plus simple pour effectuer cette mesure, et quel plan Claude correspond à votre usage est une décision distincte concernant le paiement au token.

FAQ

Quel modèle Claude est le meilleur pour le code ?

Claude Opus 4.8 est le point de départ documenté pour le codage agentique complexe. En juillet 2026, son coût est de 5 $ par million de tokens en entrée et 25 $ par million en sortie. Claude Sonnet 5 offre le meilleur équilibre entre vitesse et intelligence. Avec un tarif de 2 $ / 10 $ jusqu'au 31 août 2026, il coûte moins de la moitié du prix d'Opus. Exécutez la même tâche sur les deux modèles, maintenez la configuration de thinking constante, et comparez la consommation totale de tokens depuis response.usage.

Claude Haiku 4.5 est-il assez économique pour remplacer Sonnet 5 ?

Par token, la réponse est oui : 1 $ / 5 $ contre 2 $ / 10 $ pour Sonnet 5 en tarif de lancement, ou 3 $ / 15 $ à partir du 1er septembre 2026. Les limites techniques sont le facteur déterminant. Haiku 4.5 possède une fenêtre de contexte de 200K tokens au lieu de 1M. Il limite la sortie à 64K sur l'API Messages synchrone. Sa base de connaissances s'arrête en février 2025. Il n'offre pas de support output_config.effort. Enfin, il nécessite un prompt de 4 096 tokens minimum pour être mis en cache, ce qui désactive le caching sur les system prompts courts.

Changer de modèle Claude en cours de session permet-il d'économiser ?

Moins souvent qu'on ne le pense. Anthropic définit les invalidateurs de cache comme des modifications du préfixe tools, system ou messages, des changements de configuration de thinking, ou des changements de output_config.effort. L'impact d'un changement de modèle sur un cache existant n'est pas documenté. Considérez cet état comme inconnu et consultez cache_read_input_tokensla documentation lors de la première requête suivante. L'enjeu est réel : sur un préfixe Opus 4.8 de 150 000 tokens, une lecture de cache coûte environ 0,08 $ alors qu'une réécriture coûte environ 0,94 $. Ce coût dépasse les économies réalisées sur plusieurs tours de conversation. Changez de modèle entre deux tâches, après /clear dans Claude Code, lorsque le cache est de toute façon supprimé.

Quel est l'impact de output_config.effort sur ma facture ?

Ce paramètre modifie le nombre de tokens consommés pour le texte, les tool calls et le thinking. Un effort réduit diminue le nombre de tool calls. Cela augmente le coût dans les boucles agentiques car chaque résultat d'outil est renvoyé lors des tours suivants. Les niveaux sont low, medium, high, xhigh et max, avec high par défaut. Anthropic ne publie pas de multiplicateur de coût par niveau. L'effort est considéré comme un signal comportemental plutôt que comme un budget de tokens. Mesurez l'impact sur vos propres tâches.

Quelle est l'économie réalisée avec l'API Claude Batches ?

Vous économisez 50 % sur les tokens d'entrée et de sortie, en échange d'une livraison asynchrone. En juillet 2026, cela place Opus 4.8 à 2,50 $ en entrée / 12,50 $ en sortie, Sonnet 5 à 1 $ / 5 $ en tarif de lancement, et Haiku 4.5 à 0,50 $ / 2,50 $. La comparaison est notable entre les paliers : un job Opus 4.8 en batch coûte moins cher qu'un job Sonnet 5 synchrone au tarif standard à partir du 1er septembre 2026. Le batching permet d'utiliser un modèle plus puissant pour le même budget.