SSD Nodes Learn Hosting plans →
Guides Matt ConnorPar Matt Connor · Mis à jour le 2026-08-27

Quel modèle Claude choisir selon votre budget ?

Opus 4.8, Sonnet 5 ou Haiku 4.5 ? Comparez les tarifs de juillet 2026 et le coût réel de 100 000 tâches, selon les réglages qui pèsent sur la facture.

Quel modèle Claude devez-vous utiliser ?

La réponse courte à la question de savoir quel modèle Claude utiliser est la suivante : commencez par Claude Opus 4.8 et ne vous en écartez que pour une raison précise. Les recommandations d’Anthropic vont dans le même sens. « Si vous ne savez pas quel modèle utiliser, commencez par Claude Opus 4.8 pour le coding agentique complexe et les usages en entreprise. » Passez à Claude Sonnet 5 lorsque la tâche est bien spécifiée et que vous l’exécutez de nombreuses fois par jour. Passez ensuite à Claude Haiku 4.5 pour les tâches mécaniques à fort volume, lorsque vous savez déjà à quoi ressemble une réponse correcte. Claude Fable 5 se situe au-dessus de tous les autres modèles pour les agents qui s’exécutent sur une longue durée.

Ce choix a un coût. Voici les tarifs de la Claude API (application programming interface) au 23 juillet 2026, par million de tokens, une unité que la documentation abrège en MTok.

  • Claude Fable 5 (claude-fable-5) : $10 / MTok en entrée, $50 / MTok en sortie. Contexte de 1M.
  • Claude Opus 4.8 (claude-opus-4-8) : $5 en entrée, $25 en sortie. Contexte de 1M.
  • Claude Opus 4.7 (claude-opus-4-7) : $5 en entrée, $25 en sortie. Contexte de 1M.
  • Claude Sonnet 5 (claude-sonnet-5) : $2 en entrée, $10 en sortie avec le tarif de lancement jusqu’au 31 août 2026. Le tarif standard de $3 en entrée et $15 en sortie s’applique à partir du 1 septembre 2026. Contexte de 1M.
  • Claude Haiku 4.5 (claude-haiku-4-5) : $1 en entrée, $5 en sortie. Contexte de 200K.

Ces identifiants sont complets tels quels. Rien ne leur est ajouté.

La taille ne génère elle-même aucun surcoût sur les modèles à 1M de tokens : « Une requête de 900k tokens est facturée au même tarif par token qu’une requête de 9k tokens. » Ces tarifs s’appliquent aussi au-delà de l’API, car Claude Enterprise mesure la consommation aux tarifs de l’API en plus du prix des licences utilisateur. Le même calcul s’applique donc à une équipe disposant d’un forfait par utilisateur. Un abonnement forfaitaire modifie le mode de décompte, mais pas cette décision, puisque les deux niveaux Claude Max incluent les mêmes modèles et se distinguent uniquement par le volume d’utilisation inclus. Plus bas dans cette gamme, l’abonnement Claude Pro à $20 par mois fournit un quota d’utilisation plutôt qu’un tarif par token. Ce qui vous bloque est alors la réinitialisation de la limite, et non une facture. Si vous êtes dans cette situation, déterminer la fenêtre que vous attendez doit précéder les calculs ci-dessous. La solution consiste à utiliser un modèle plus petit, un contexte plus court ou l’API, et non à rechercher un tarif inférieur. Si vous n’avez encore rien payé, déterminer si Pro justifie réellement les $20 dépend d’abord de la fréquence à laquelle la limite gratuite vous bloque, et non des tarifs ci-dessus.

À quoi sert réellement chaque modèle

Anthropic décrit la gamme en une phrase par modèle. Ces descriptions orientent mieux que n’importe quel classement.

  • Claude Fable 5 : « Intelligence de nouvelle génération pour les agents exécutés sur de longues durées. » C’est le plus lent des quatre en matière de latence.
  • Claude Opus 4.8 : « Pour le coding agentique complexe et les tâches d’entreprise. » Latence modérée.
  • Claude Sonnet 5 : « Le meilleur équilibre entre vitesse et intelligence. » Rapide.
  • Claude Haiku 4.5 : « Le modèle le plus rapide, avec une intelligence proche de la frontière technologique. »

Fable 5 est le seul des quatre que cette comparaison ne chiffre jamais sur une charge de travail. Comme son tarif est deux fois supérieur à celui d’Opus 4.8, la question de quels travaux justifient 10 $ de dépense pour 50 $ de résultat mérite une réponse distincte.

Haiku 4.5 impose également des limites qui déterminent l’adéquation à une tâche avant même le prix. Sa fenêtre de contexte est de 200K tokens au lieu de 1M. Un dépôt volumineux ou une longue transcription d’agent ne pourra donc pas y tenir. Sa sortie maximale avec l’API Messages synchrone est de 64K tokens, contre 128K pour les trois autres modèles. Sa date limite de connaissances fiable est février 2025, alors que celle des trois autres est janvier 2026.

Quel coût ce choix représente-t-il sur une charge de travail réelle ?

Tous les modèles de la gamme facturent la sortie cinq fois plus cher que l’entrée. Opus 4.8 coûte $5 en entrée et $25 en sortie. Haiku 4.5 coûte $1 en entrée et $5 en sortie. Ce ratio reste le même sur toute la gamme. Le modèle choisi a donc surtout un impact sur les tâches qui génèrent beaucoup de sortie.

Le travail agentique entre dans cette catégorie, car les tokens de réflexion sont facturés comme des tokens de sortie et comptabilisés dans max_tokens, même si le texte ne vous est jamais transmis. Avec Fable 5, Opus 4.8, Opus 4.7 et Sonnet 5, le résumé du raisonnement est omis par défaut. Le champ thinking est donc renvoyé vide. La facturation ne change pas : « Dans les deux cas, le bloc est facturé de la même manière et renvoyé de la même manière dans les conversations à plusieurs tours. » Ce qui compose réellement une facture Claude détaille entièrement ce calcul.

Le fonctionnement de la réflexion peut différer entre les modèles que vous comparez. Si vous ne tenez pas compte de ce point, votre test de coût sera faussé. Avec Sonnet 5 et Fable 5, la réflexion est déjà activée et ne nécessite aucune configuration. Avec Opus 4.8 et Opus 4.7, elle est désactivée tant que vous n’avez pas défini thinking: {type: "adaptive"} dans la requête. Utilisez la même configuration des deux côtés avant d’interpréter les chiffres.

Pourquoi le modèle le moins cher peut coûter le plus cher

Prenons une tâche de programmation autonome. La requête contient 60,000 tokens de contexte, et le modèle produit 8,000 tokens de sortie, raisonnement compris. Il n’y a pas de mise en cache : le calcul reste donc visible.

Avec Opus 4.8, 0.06 MTok d’entrée à $5 coûtent $0.30, et 0.008 MTok de sortie à $25 coûtent $0.20. La tentative coûte $0.50. Avec Haiku 4.5, la même tentative coûte $0.06 plus $0.04, soit $0.10.

Haiku coûte cinq fois moins cher par tentative. Cela semble laisser une marge importante, jusqu’à ce que vous examiniez les conséquences d’un échec. Vous lisez la mauvaise réponse, ce qui vous prend du temps. Vous la renvoyez dans le contexte lors de la nouvelle tentative, et chaque tentative est donc plus volumineuse que la précédente. Si la troisième tentative échoue encore, vous passez malgré tout au modèle supérieur : $0.30 de Haiku plus $0.50 d’Opus, soit $0.80, ou 60% de plus qu’une exécution unique avec Opus.

La question déterminante est donc de savoir à quel point vous pouvez vérifier la réponse rapidement. Lorsque vous repérez une mauvaise réponse en une seconde, le petit modèle est avantageux. Lorsque cela exige de lire attentivement un diff, le petit modèle vous prend du temps qui n’apparaît jamais sur la facture. Chiffrer ce temps revient à calculer si un abonnement Claude Code est rentable, et dès que votre propre taux horaire entre dans le calcul, le modèle le moins cher cesse souvent de paraître bon marché.

Dans quels cas un modèle plus petit est nettement meilleur

Haiku 4.5 est le bon choix dans les cas suivants :

  • Tâches mécaniques confiées à un sous-agent. Un sous-agent qui renomme des fichiers ou collecte les résultats d’une recherche n’a pas besoin d’un raisonnement de pointe. C’est le schéma standard lorsque vous créez un agent IA avec Claude et lui fournissez des assistants.
  • Triage des journaux. Déterminer si une ligne est du bruit ou si elle mérite l’attention d’un humain est un jugement limité, avec un mode d’échec évident.
  • Classification selon un ensemble fixe d’étiquettes. La sortie est courte et la précision est mesurable sur un échantillon.
  • Appels de production à haut volume. À 100,000 exécutions par jour, l’écart par token n’est plus négligeable. C’est le schéma habituel des workflows IA intégrés à n8n.
  • Tous les cas où la vitesse de réponse est importante pour l’utilisateur. Haiku 4.5 est présenté comme le modèle le plus rapide de la gamme.

Une limite concerne spécifiquement Haiku. Son prompt minimal pouvant être mis en cache contient 4,096 tokens, contre 1,024 pour Opus 4.8 et Sonnet 5. En dessous de ce seuil, « toute requête visant à mettre en cache moins de tokens sera traitée sans mise en cache et aucune erreur ne sera renvoyée ». Un bloc d’instructions de 1,500 tokens mis en cache avec Sonnet 5 ne l’est donc pas avec Haiku 4.5, sans avertissement. L’indicateur est que cache_creation_input_tokens et cache_read_input_tokens sont tous deux à zéro. La section réduire les coûts d’un agent toujours actif présente ce point ainsi que les autres causes de perte du cache.

Les leviers qui changent la réponse

Chacun de ces leviers a plus d’effet sur la facture que le nom du modèle.

Effort. output_config.effort contrôle la quantité de travail effectuée par le modèle avant sa réponse. Les niveaux sont low, medium, high, xhigh et max, et high est la valeur par défaut : « Définir effort sur high produit exactement le même comportement que l’omission complète du paramètre effort. » Ce paramètre est imbriqué dans output_config au lieu de se trouver au niveau racine de la requête :

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    messages=messages,
)

Effort concerne chaque token de la réponse : « Il peut modifier toute la consommation de tokens, y compris les appels d’outils. Par exemple, un niveau d’effort inférieur signifie que Claude effectue moins d’appels d’outils. » Cet effet se cumule dans une boucle agentique. Ce n’est pas une limite de tokens : « Effort est un signal comportemental, pas un budget de tokens strict. » Anthropic ne publie aucun coefficient de coût pour chaque niveau et vous recommande de tester votre propre cas d’usage. Une exécution de Sonnet 5 avec high comparée à une exécution d’Opus 4.8 avec low constitue donc une comparaison réelle que vous pouvez effectuer cet après-midi. Haiku 4.5 ne figure pas dans la liste des modèles compatibles avec effort.

Mise en cache des prompts. La lecture du cache coûte 0.1x le tarif d’entrée de base. Pour choisir un modèle, il faut donc examiner l’effet de cette réduction entre les différents niveaux. Un cache hit sur Opus 4.8 coûte $0.50 / MTok, tandis qu’une entrée sans cache sur Haiku 4.5 coûte $1 / MTok. Un préfixe Opus correctement mis en cache revient donc moins cher par token d’entrée qu’un prompt Haiku non mis en cache. Pour toute charge de travail qui renvoie un préfixe stable volumineux, une bonne gestion des sessions est plus importante que le choix du modèle.

Traitement par lots. Si aucune réponse n’est attendue immédiatement, l’API Message Batches exécute les mêmes modèles avec « une remise de 50% sur les tokens d’entrée et de sortie ». Elle divise par deux chaque ligne de la comparaison ci-dessous et fonctionne entre les différents niveaux : une tâche Opus 4.8 exécutée par lots coûte moins cher qu’une tâche Sonnet 5 synchrone au tarif standard applicable depuis le 1 septembre 2026. Vous échangez ainsi de la latence contre des capacités, à budget identique.

Un exemple complet de comparaison des coûts

La charge de travail : classer 100,000 e-mails du support, avec un appel par e-mail, 2,000 tokens d’entrée et 300 tokens de sortie par appel. Cela représente 200 MTok d’entrée et 30 MTok de sortie.

  • Haiku 4.5 : 200 x $1 = $200 en entrée, 30 x $5 = $150 en sortie. Total : $350.
  • Sonnet 5, tarif de lancement : 200 x $2 = $400 en entrée, 30 x $10 = $300 en sortie. Total : $700.
  • Sonnet 5, à partir du 1 septembre 2026 : 200 x $3 = $600 en entrée, 30 x $15 = $450 en sortie. Total : $1,050.
  • Opus 4.8 : 200 x $5 = $1,000 en entrée, 30 x $25 = $750 en sortie. Total : $1,750.

Remplacez quatre nombres pour refaire le calcul avec les tarifs de demain. Les ajustements ci-dessous modifient davantage le résultat que le nom du modèle :

  • Le batching divise chaque ligne par deux : $175, $350, $525 et $875. Rien n’attend une exécution nocturne de la classification, donc il n’y a aucune raison de s’en priver.
  • Mise en cache du préfixe commun. Supposons que 1,200 des 2,000 tokens d’entrée constituent à chaque fois le même bloc d’instructions. Avec Sonnet 5 au tarif de lancement, ces tokens coûtent $0.20 / MTok lorsqu’ils proviennent du cache, au lieu de $2 / MTok. Les 120 MTok coûtent donc $24 au lieu de $240. Ajoutez 80 MTok d’entrée nouvelle à $2, soit $160, plus $300 de sortie : Sonnet 5 revient à environ $484 au lieu de $700. La même méthode ne change rien avec Haiku 4.5, car 1,200 tokens est inférieur à son minimum de 4,096 tokens.
  • Retries. Supposons que vous rejetiez la réponse de Haiku pour 8% des e-mails et que vous relanciez ces requêtes avec Opus 4.8. Ajoutez 0.08 x $1,750 = $140 aux $350, soit $490. Mesurez votre propre taux de rejet au lieu de reprendre le mien.
  • Définitions d’outils, si la tâche les utilise. Le system prompt qu’elles génèrent contient 290 tokens avec Opus 4.8 lorsque tool_choice est défini sur auto, 354 avec Sonnet 5 et 496 avec Haiku 4.5. Le modèle le moins cher supporte la surcharge fixe la plus importante.

Haiku avec un chemin d’escalade à $490 et Sonnet 5 avec mise en cache à $484 coûtent pratiquement la même chose, et l’un des deux réalise la tâche en un seul passage. Le modèle n’a jamais été le seul élément à prendre en compte.

Changer de modèle au milieu d’une session permet-il d’économiser de l’argent ?

Moins souvent que ne le laissent penser les prix affichés, car l’économie se fait par token alors que ce que vous risquez de perdre est l’intégralité d’un préfixe mis en cache.

Anthropic documente les événements qui invalident un cache. Les préfixes sont construits dans l’ordre tools, puis system, puis messages, et « Les modifications apportées à chaque niveau invalident ce niveau et tous les niveaux suivants. » Deux paramètres de requête figurent également dans cette liste : « La configuration du raisonnement et le niveau effort résolu sont intégrés directement au prompt ; toute modification de l’un d’eux démarre donc un nouveau préfixe de cache. » Pour le niveau d’effort, la documentation va plus loin : « Faites varier l’effort entre les charges de travail plutôt qu’au sein d’une conversation qui dépend des cache hits ».

Le modèle ne figure pas dans cette liste documentée. Ne partez donc pas du principe que le changer invalide le cache, ni du contraire. Lisez cache_read_input_tokens sur la première requête suivant le changement et laissez la valeur vous répondre. Pour un préfixe de 150,000 tokens avec Opus 4.8, la lecture du cache coûte environ $0.08 et l’écriture d’un nouveau préfixe environ $0.94. Cela représente plus que plusieurs tours de la différence de prix par token que vous cherchiez à exploiter.

Effectuez donc ces changements entre les tâches, et non au cours d’une même tâche. Dans Claude Code, cela signifie d’abord /clear, lorsque le cache est de toute façon abandonné, puis /model ou /effort. Ces deux commandes se saisissent dans la CLI. Si vous travaillez sous Linux, l’installation la plus utile est donc celle du terminal, car la version qu’Anthropic fournit nativement pour Linux associe une CLI stable à une application de bureau encore en bêta. La présence ou non de ce changement sur votre facture dépend du mode de paiement de la session, car Claude Code fonctionne soit avec un forfait mensuel fixe, soit avec des crédits API facturés au token et seul le second mode facture un changement de modèle en dollars. Avec le forfait fixe, le coût d’utilisation d’un modèle plus puissant se mesure dans votre fenêtre d’utilisation, et non sur votre facture. De plus, Claude Code est inclus à partir de Pro et utilise la même fenêtre que les applications de chat : une heure d’Opus dans le terminal est donc une heure que vous ne passez pas dans le navigateur.

Tester la réponse sur votre propre charge de travail

Ne dimensionnez pas un prompt à partir d’un nombre obtenu avec un autre modèle. L’endpoint de comptage des tokens est gratuit et utilise le tokenizer du modèle que vous indiquez. Indiquez donc le modèle que vous prévoyez d’appeler. Cet endpoint fait partie des rares éléments de la plateforme qui ne sont jamais facturés, et ce que vous pouvez aussi exécuter gratuitement mérite d’être vérifié avant de dépenser du crédit pour une comparaison. Opus 4.7 et les versions ultérieures, Fable 5 et Sonnet 5 utilisent un tokenizer plus récent qui « produit environ 30 % de tokens en plus pour un même texte ». À tarif inchangé par token, un budget mesuré avec un ancien modèle est donc insuffisant pour un modèle plus récent.

Lisez ensuite la réponse obtenue. input_tokens correspond uniquement à la partie non mise en cache. La taille réelle du prompt est donc la somme de ce champ, de cache_creation_input_tokens et de cache_read_input_tokens. Votre première application Claude API sur un VPS est l’endroit le plus simple et le plus fiable pour effectuer cette mesure. Quel forfait Claude correspond à votre usage concerne une autre décision : faut-il payer au token ou non ? Si la question devient celle de l’abonnement à conserver plutôt que celle de souscrire ou non, Les offres Claude comparées aux forfaits ChatGPT indique le coût du même travail de développement chez l’autre fournisseur. Si la mesure vous conduit définitivement à utiliser l’API, passer à un forfait inférieur ou supprimer l’abonnement vous permet tout de même de conserver la période déjà payée. Vous ne risquez donc aucune pénalité en décidant après avoir obtenu les chiffres. Effectuez la même mesure pour une équipe plutôt que pour une seule personne : le calcul change encore, car un forfait Team ou Enterprise doit être plus avantageux que ce que cette personne aurait dépensé au token pour justifier son achat.

FAQ

Quel modèle Claude est le plus adapté au code ?

Claude Opus 4.8 est le point de départ documenté pour les tâches de programmation agentique complexes, à $5 par million de tokens en entrée et $25 par million en sortie en juillet 2026. Claude Sonnet 5 est présenté comme le meilleur compromis entre vitesse et intelligence. À $2 / $10 jusqu’au 31 août 2026, il coûte moins de la moitié du prix. Exécutez la même tâche avec les deux modèles, gardez la configuration de raisonnement constante, puis comparez la consommation totale de tokens à partir de response.usage.

Claude Haiku 4.5 est-il suffisamment bon marché pour remplacer Sonnet 5 ?

Par token, oui : $1 / $5 contre $2 / $10 pour Sonnet 5 au tarif de lancement, ou $3 / $15 à partir du 1 septembre 2026. Ce sont les limites qui tranchent. Haiku 4.5 dispose d’une fenêtre de contexte de 200K tokens au lieu de 1M, d’une sortie maximale de 64K tokens avec l’API Messages synchrone, d’une date de coupure des connaissances fiable en février 2025, ne prend pas en charge output_config.effort et impose un prompt de 4,096 tokens minimum pour la mise en cache, ce qui désactive discrètement le cache avec les prompts système courts.

Passer à un modèle Claude moins cher en cours de session permet-il de réduire les coûts ?

Moins souvent qu’il n’y paraît. Anthropic documente comme invalidateurs du cache les modifications du préfixe tools, system ou messages, les modifications de la configuration de raisonnement et les modifications de output_config.effort. Le comportement d’un changement de modèle vis-à-vis d’un cache existant n’est pas documenté. Considérez-le donc comme inconnu et consultez cache_read_input_tokens lors de la première requête suivante. L’enjeu est réel : avec un préfixe Opus 4.8 de 150,000 tokens, la lecture du cache coûte environ $0.08 et une nouvelle écriture environ $0.94. Cela dépasse les économies réalisées sur plusieurs tours grâce au tarif par token. Changez de modèle entre les tâches, après /clear dans Claude Code, lorsque le cache est de toute façon supprimé.

Quel effet output_config.effort a-t-il sur ma facture ?

Ce paramètre modifie le nombre de tokens que le modèle consomme pour le texte, les appels d’outils et le raisonnement. Un niveau d’effort inférieur entraîne moins d’appels d’outils. L’effet se cumule dans les boucles agentiques, car chaque résultat d’outil est renvoyé lors des tours suivants. Les niveaux sont low, medium, high, xhigh et max, avec high comme valeur par défaut. Anthropic ne publie aucun multiplicateur de coût par niveau. L’entreprise considère l’effort comme un signal comportemental et non comme un budget de tokens. Mesurez donc son effet sur votre propre tâche.

Quelle économie l’API Claude Batches permet-elle de réaliser ?

50 % sur les tokens en entrée comme en sortie, en échange d’une livraison asynchrone. En juillet 2026, cela porte le tarif d’Opus 4.8 à $2.50 en entrée / $12.50 en sortie, celui de Sonnet 5 à $1 / $5 au tarif de lancement, et celui de Haiku 4.5 à $0.50 / $2.50. La comparaison la plus intéressante porte sur les différents niveaux : une tâche Opus 4.8 traitée par lots coûte moins cher qu’une tâche Sonnet 5 synchrone au tarif standard à partir du 1 septembre 2026. Le traitement par lots permet donc d’utiliser un modèle plus puissant pour le même budget.