Claude Fable 5 : prix et cas d’usage
Claude Fable 5 coûte 10 $ par million de tokens d’entrée et 50 $ en sortie. Découvrez ce que ces tarifs catalogue impliquent pour vos tâches réelles.
Combien coûte Claude Fable 5 ?
Claude Fable 5 coûte $10 par million de tokens d’entrée et $50 par million de tokens de sortie sur l’API Claude. Il s’agit des tarifs catalogue publiés par Anthropic, relevés sur la page des tarifs le 3 août 2026. L’identifiant du modèle dans l’API est claude-fable-5. Le modèle est devenu généralement disponible le 9 juin 2026 sur l’API Claude, Amazon Bedrock, Claude Platform on AWS, Google Cloud et Microsoft Foundry.
The data behind this chart
[
{
"label": "Claude Fable 5",
"input": "10",
"output": "50",
"cache_read": "1",
"batch_input": "5",
"batch_output": "25"
},
{
"label": "Claude Opus 5",
"input": "5",
"output": "25",
"cache_read": "0.50",
"batch_input": "2.50",
"batch_output": "12.50"
},
{
"label": "Claude Sonnet 5 (intro rate)",
"input": "2",
"output": "10",
"cache_read": "0.20",
"batch_input": "1",
"batch_output": "5"
},
{
"label": "Claude Sonnet 5 (from 1 Sep)",
"input": "3",
"output": "15",
"cache_read": "0.30",
"batch_input": "1.50",
"batch_output": "7.50"
},
{
"label": "Claude Haiku 4.5",
"input": "1",
"output": "5",
"cache_read": "0.10",
"batch_input": "0.50",
"batch_output": "2.50"
}
]Considérez ces tarifs comme une échelle. Fable 5 est affiché au double de Claude Opus 5, à cinq fois le tarif actuel de Claude Sonnet 5 et à dix fois celui de Claude Haiku 4.5. Le rapport est identique pour les deux types de tokens, car chaque modèle de ce tableau facture les tokens de sortie exactement cinq fois son propre tarif d’entrée. Si vous connaissez la répartition entre tokens d’entrée et de sortie d’une tâche, vous pouvez donc convertir un tarif en un autre par multiplication.
Une date modifie le calcul. Sonnet 5 bénéficie d’un tarif de lancement de $2 et $10 par million de tokens jusqu’au 31 août 2026. À partir du 1 septembre 2026, son tarif catalogue sera de $3 et $15. Le tarif de Fable 5 ne change pas. L’écart entre les deux modèles passe donc de cinq fois à un peu plus de trois fois ce jour-là. Si vous préparez un budget pour l’automne, utilisez les tarifs ultérieurs de Sonnet.
Les remises et le seul multiplicateur qui augmente la facture
La mise en cache des prompts est le levier le plus important. La lecture du cache coûte un dixième du tarif d’entrée de base, soit $1 par million de tokens avec Fable 5. L’écriture dans le cache coûte plus cher qu’un token d’entrée ordinaire : 1.25 fois le tarif de base pour le cache de cinq minutes et 2 fois ce tarif pour le cache d’une heure. Un cache de cinq minutes est rentabilisé après une seule lecture, et un cache d’une heure après deux lectures. Ce calcul suffit à justifier le calcul du seuil de rentabilité de la mise en cache des prompts avant de l’activer partout.
La Batch API réduit de 50% le coût des deux côtés. Un traitement Fable 5 par lots coûte donc $5 par million de tokens d’entrée et $25 par million de tokens de sortie. Les requêtes par lots sont asynchrones. Cette remise ne s’applique donc qu’aux traitements qui n’ont pas besoin d’une réponse immédiate. Les deux remises se cumulent, ce qui rend un traitement mis en cache et exécuté par lots peu coûteux sur les deux postes.
La fenêtre de contexte de 1M tokens est incluse aux tarifs standard avec Claude 4.6 et les modèles ultérieurs. Aucun supplément ne s’applique aux contextes longs. Une requête de 900k tokens est donc facturée au même tarif par token qu’une requête de 9k tokens.
Le multiplicateur qui augmente la facture concerne la résidence des données. La définition de inference_geo: "us" pour maintenir l’inférence aux États-Unis applique un multiplicateur de 1.1 à chaque catégorie de tokens, y compris les lectures et les écritures du cache. Conservez le routage global par défaut, sauf si un contrat impose une autre configuration.
Une règle de facturation est propre à ce modèle. Fable 5 intègre des classifieurs de sécurité qui peuvent refuser une requête. Dans ce cas, la Messages API renvoie stop_reason: "refusal" avec une réponse HTTP 200 indiquant une réussite, et aucun frais ne s’applique si la requête est refusée avant la génération de la moindre sortie. Si vous réessayez le même prompt avec un autre modèle Claude, le crédit de repli rembourse le coût de la mise en cache du prompt lié au changement de modèle. Vous ne payez donc pas deux fois pour amorcer le même cache.
Quels forfaits incluent Claude Fable 5 ?
Au 3 août 2026, la page Claude d’Anthropic indique que le modèle est disponible pour les utilisateurs Pro, Max, Team et Enterprise. Le forfait gratuit n’est pas mentionné. Pour les développeurs, il est généralement disponible via l’API Claude et les marketplaces cloud listées plus haut.
La disponibilité dans un forfait ne signifie pas un accès illimité sans frais supplémentaires. Le tableau comparatif des forfaits sur la page tarifaire d’Anthropic limite Fable à une part des plafonds d’utilisation hebdomadaires pour certains comptes et à des crédits d’utilisation pour d’autres. Ces modalités ont changé plusieurs fois en juillet 2026. Dans sa propre annonce sur le redéploiement de Fable 5, Anthropic indiquait que le modèle pouvait représenter jusqu’à 50% des plafonds d’utilisation hebdomadaires jusqu’au 7 juillet 2026 pour les forfaits Pro, Max, Team et certains forfaits Enterprise, puis qu’il nécessiterait des crédits d’utilisation. Les informations publiées le reste du mois de juillet faisaient état de nouvelles prolongations et d’une distinction entre les types de comptes.
Cette page ne donne donc pas de limite par forfait. Aucun chiffre publié pendant ce mois n’est resté valable quinze jours, et un chiffre obsolète serait plus trompeur que son absence. Ouvrez la ligne intitulée Fable dans le tableau comparatif des forfaits le jour où vous prenez votre décision, et considérez tout chiffre publié dans un article d’actualité comme obsolète.
Ce qui reste stable, ce sont les tarifs de l’API. Sur chaque route, une fois le quota inclus épuisé, toute utilisation supplémentaire de Fable 5 est facturée aux tarifs indiqués dans le tableau ci-dessus. C’est donc la grille tarifaire qui doit servir de référence pour vos prévisions dans les deux cas. Vous arrivez à la même conclusion en comparant la facturation de l’API à un abonnement pour n’importe quel autre modèle Claude. Si vous n’avez pas encore choisi de niveau, commencez par quel forfait Claude correspond à votre utilisation.
Pourquoi votre facture dépasse le ratio de prix annoncé
Deux mécanismes documentés expliquent pourquoi Fable 5 coûte plus cher que ne le laisse penser une simple comparaison des prix.
Le premier concerne le tokenizer. Fable 5 utilise le tokenizer introduit avec Claude Opus 4.7. Par rapport aux modèles sortis avant Opus 4.7, le même texte produit environ 30% de tokens supplémentaires, selon son contenu. Haiku 4.5 est antérieur à ce tokenizer. L’écart de dix fois affiché dans la grille tarifaire est donc plus proche de treize fois lorsque vous envoyez le même bloc de texte aux deux modèles. Sonnet 5 utilise le nouveau tokenizer. La comparaison du prix par token avec Sonnet est donc pertinente. Avec Haiku, elle ne l’est pas.
Le second concerne le thinking. Le thinking adaptatif est toujours activé pour Fable 5, et thinking: {"type": "disabled"} n’est pas pris en charge. Les tokens de thinking sont facturés comme des tokens de sortie, au tarif complet des sorties. La chaîne de pensée brute n’est jamais renvoyée par ce modèle, et thinking.display prend par défaut la valeur "omitted". Une réponse visible courte peut donc correspondre à un nombre élevé de tokens de sortie facturés. La documentation d’Anthropic l’indique clairement : le nombre de tokens de sortie facturés ne correspond pas au nombre de tokens visibles dans la réponse.
Consultez le détail au lieu de faire des suppositions. Le champ usage.output_tokens_details.thinking_tokens indique combien de tokens de sortie facturés ont été consacrés au raisonnement :
{
"usage": {
"input_tokens": 25,
"output_tokens": 348,
"output_tokens_details": {
"thinking_tokens": 312
}
}
}Dans cet exemple, tiré de la documentation d’Anthropic sur le thinking, 312 des 348 tokens de sortie facturés correspondentaient à un raisonnement que personne n’a vu. En streaming, ce détail n’arrive que dans l’événement message_delta final. Un client qui cesse de lire après le dernier bloc de texte ne l’enregistrera donc jamais.
Le paramètre de contrôle est effort. Il est défini à output_config.effort et accepte les niveaux low, medium, high (valeur par défaut), xhigh et max.
{
"model": "claude-fable-5",
"max_tokens": 32000,
"output_config": { "effort": "medium" },
"messages": [{ "role": "user", "content": "..." }]
}Anthropic recommande, pour ce modèle, de commencer avec high, de passer à xhigh uniquement pour les tâches les plus sensibles aux capacités, puis de descendre à medium ou low pour les tâches courantes. Selon Anthropic, un niveau d’effort inférieur sur Fable 5 donne souvent de meilleurs résultats que xhigh sur les modèles précédents. Deux pièges sont à prendre en compte. Modifier le niveau d’effort entre deux requêtes invalide le prompt cache, car la valeur d’effort résolue est intégrée au prompt. Choisissez donc un niveau par workload et conservez-le. Par ailleurs, max_tokens impose une limite stricte au nombre total de tokens de sortie, en additionnant le thinking et le texte de réponse. Une limite dimensionnée pour une réponse sans thinking entraînera donc une troncature. Si vous voyez stop_reason: "max_tokens", augmentez la limite ou réduisez le niveau d’effort.
Coût par tâche terminée, pas coût par token
The data behind this chart
[
{
"label": "Short answer (5k in, 1k out)",
"fable_5": "0.10",
"opus_5": "0.05",
"sonnet_5": "0.02",
"haiku_4_5": "0.01"
},
{
"label": "Coding session (300k in, 40k out)",
"fable_5": "5.00",
"opus_5": "2.50",
"sonnet_5": "1.00",
"haiku_4_5": "0.50"
},
{
"label": "Long agent run (2M in, 400k out)",
"fable_5": "40.00",
"opus_5": "20.00",
"sonnet_5": "8.00",
"haiku_4_5": "4.00"
}
]Ces 3 lignes relèvent de l’arithmétique, pas d’un benchmark. Les tarifs sont publiés. Les volumes de tokens sont des hypothèses que vous devez remplacer par les chiffres de vos propres données d’utilisation. Une session de développement correspondant à la ligne intermédiaire coûte $5.00 avec Fable 5, contre $1.00 avec Sonnet 5. La longue exécution coûte $40.00, contre $8.00. La colonne Haiku de cette dernière ligne ne présente qu’un calcul arithmétique : Haiku 4.5 dispose d’une fenêtre de contexte de 200k tokens et ne peut donc pas contenir cette tâche.
Le coût par token n’est pas la bonne unité pour prendre une décision. Le coût par tâche terminée correspond au coût d’une tentative multiplié par le nombre de tentatives. Aux tarifs actuels, une tentative avec Fable 5 coûte autant que cinq tentatives avec Sonnet 5. Le seul nombre de nouvelles tentatives justifie donc presque jamais la mise à niveau. Sonnet devrait échouer plus de quatre fois sur cinq pour que l’option moins chère perde sur le coût en tokens.
Ce qui justifie cette décision, c’est tout ce que la facture de tokens ne prend pas en compte. Dans la plupart des marchés, l’écart entre les deux longues exécutions du graphique est inférieur au coût d’une heure de travail d’un ingénieur. Si le modèle plus coûteux vous fait économiser une heure de revue ou évite une migration incorrecte que vous devriez ensuite défaire, il est déjà rentabilisé, même si la facture ne montre pas cette économie. Faites la comparaison en coût par résultat accepté et incluez votre propre temps dans le total. Savoir ce qu’achètent réellement un million de tokens rend cette estimation beaucoup moins abstraite.
Trois tâches pour lesquelles Claude Fable 5 justifie son prix
Les exécutions d’agent longues, lorsqu’une mauvaise décision coûte cher. Fable 5 est conçu pour les tâches qui se mesurent en heures : une fenêtre de contexte de 1M de tokens, jusqu’à 128k tokens de sortie par requête et un niveau d’effort xhigh destiné aux tâches de plus de trente minutes, avec des budgets de tokens se chiffrant en millions. Comparez le coût de l’exécution au travail de nettoyage nécessaire lorsqu’un agent prend une mauvaise branche à l’étape 40, sans que personne ne s’en aperçoive avant l’étape 300.
Une migration ou un audit exécuté une seule fois sur une base de code volumineuse. Un travail ponctuel ne permet pas d’amortir les coûts par le volume. Le supplément par token est donc facturé sur une seule facture, et l’ensemble de la tâche peut tenir dans une seule fenêtre de contexte. Si la tâche peut s’exécuter de manière asynchrone, la Batch API divise son coût par deux, à $25 par million de tokens de sortie.
La tâche sur laquelle un modèle moins cher a déjà échoué deux fois. Deux tentatives infructueuses, auxquelles s’ajoute votre temps de débogage, coûtent plus cher qu’une tentative avec Fable aux volumes indiqués dans le graphique ci-dessus. Passer au niveau supérieur est l’option la moins coûteuse. C’est précisément le rôle d’une hiérarchie de modèles. Si vous hésitez encore entre les niveaux en général, la comparaison des capacités entre les niveaux de modèles Claude répond à une question différente de celle traitée sur cette page.
Trois cas où Sonnet 5 ou Haiku 4.5 est le choix réaliste
Classification et extraction à haut volume. Ces tâches sont évaluées sur le débit et le coût unitaire. Leur niveau de qualité maximal est suffisamment bas pour qu’un modèle peu coûteux l’atteigne. Pour une tâche que Haiku 4.5 exécute correctement, payer dix fois plus cher pour Fable 5 n’apporte aucun gain mesurable.
Travail interactif où la latence est le produit. Le tableau des modèles d’Anthropic indique que la latence comparative de Fable 5 est plus élevée. Le mode de réflexion ne peut pas être désactivé. Une boîte de dialogue ou la complétion dans un éditeur donne une moins bonne expérience avec le modèle le plus puissant, car les utilisateurs perçoivent l’attente avant de percevoir la qualité.
Tout ce qui dépend d’événements postérieurs à janvier 2026. La date limite fiable des connaissances de Fable 5 est janvier 2026. Celle d’Opus 5 est mai 2026. Le modèle le plus cher est le moins à jour. Pour les questions d’actualité, vous payez donc deux fois plus cher pour des connaissances plus anciennes, sauf si vous lui fournissez des outils de recherche ou de récupération.
Une contrainte est totalement indépendante du coût. Fable 5 conserve les données pendant 30 days et n’est pas disponible avec une conservation nulle des données, car il est désigné comme Covered Model. Si votre contrat exige une conservation nulle, Fable 5 n’est une option à aucun prix. Aucune remise ne change cette contrainte.
Ce que montrent les dépôts fable-method et ce qu’ils ne montrent pas
Des praticiens ont publié des dépôts qui synthétisent la manière dont fonctionnent les approches Fable 5, afin qu’un modèle moins coûteux puisse les suivre sous forme de compétences. Le dépôt fable-method décrit une compétence de réflexion, une boucle d’orchestration et un vérificateur adversarial qui réexécute chaque contrôle revendiqué au lieu de lire le propre compte rendu de l’agent. Son README l’indique directement : « Il s’agit d’une synthèse communautaire, pas d’un artefact Anthropic. »
Considérez-le exactement comme tel. Il montre comment des utilisateurs pilotent le modèle, mais ne documente pas son fonctionnement. Anthropic n’a rien validé dans ce dépôt. Plusieurs forks presque identiques, avec des formulations différentes, existent également. Cela correspond à ce que l’on attend d’une tradition empirique, pas d’une spécification.
Pour décider du coût, le signal utile est que les éléments que les utilisateurs ont jugé utile de copier sont procéduraux. Classez la tâche, indiquez le contrôle qui prouve qu’elle est terminée, réunissez les éléments probants avant de décider, puis vérifiez par observation plutôt qu’en lisant un résumé. Un modèle moins coûteux auquel on fournit une checklist explicite et une étape de vérification réduit une partie de l’écart. Faites donc cette expérience sur votre propre jeu d’évaluation avant de standardiser l’utilisation du modèle coûteux. Le résultat dépend de vos tâches. C’est pourquoi le chiffre obtenu par quelqu’un d’autre vous apprend peu de choses.
Vérifiez vos propres chiffres avant d’engager un budget
- Consultez
usagedans chaque réponse et consignezoutput_tokens_details.thinking_tokensséparément de la sortie visible. Le raisonnement que vous ne voyez jamais est le poste qui crée les mauvaises surprises. - Définissez explicitement
effortau lieu d’accepter la valeur par défaut, et gardez-le constant dans toute conversation qui utilise la mise en cache des prompts. - Placez d’abord votre préfixe stable derrière un point de mise en cache. Une lecture du cache à un dixième du prix de l’entrée de base permet d’économiser davantage que la plupart des changements vers un modèle moins cher.
- Transférez vers la Batch API tout ce qui ne nécessite pas de réponse immédiate.
- Évaluez honnêtement l’alternative. Comparer les tarifs des API Claude et ChatGPT sur votre propre charge de travail vaut un après-midi avant de prendre un engagement à long terme.
Si la charge de travail est un agent exécuté sur votre propre serveur, les contrôles les plus importants se situent en dehors du choix du modèle. Maîtriser les coûts d’un agent sur un VPS présente les limites de boucle et les plafonds de dépense qui arrêtent une session qui s’emballe, tandis que où Claude Code consomme réellement des tokens explique les chiffres affichés dans votre tableau de bord d’utilisation.
FAQ
Combien coûte Claude Fable 5 par million de tokens ?
Claude Fable 5 est facturé $10 par million de tokens d’entrée et $50 par million de tokens de sortie sur l’API Claude, selon la page tarifaire d’Anthropic consultée le 3 août 2026. La lecture du cache coûte $1 par million de tokens, soit un dixième du tarif d’entrée de base. La Batch API applique une remise de 50 % aux deux catégories, soit $5 et $25 par million de tokens pour les traitements asynchrones. Le fait de conserver l’inférence aux États-Unis avec le paramètre inference_geo applique un multiplicateur de 1.1 à chaque catégorie.
Claude Fable 5 est-il inclus dans un abonnement Claude Pro ?
La page Anthropic consacrée à Claude Fable indique que le modèle est disponible pour les utilisateurs Pro, Max, Team et Enterprise, sans mentionner l’offre gratuite. L’accès inclus n’est pas illimité. Certains abonnements donnent accès à Fable dans le cadre des limites d’utilisation hebdomadaires, tandis que d’autres utilisent des crédits d’utilisation. Ce fonctionnement a changé plusieurs fois en juillet 2026. Consultez la ligne Fable du tableau comparatif des offres sur la page tarifaire d’Anthropic le jour où vous prenez votre décision, plutôt que de vous fier à un chiffre publié dans un article. Une fois le quota inclus épuisé, l’utilisation supplémentaire est facturée au tarif de l’API.
Pourquoi ma facture Claude Fable 5 est-elle plus élevée que ne le laisse penser la sortie visible ?
Le raisonnement adaptatif est toujours activé pour Claude Fable 5. Les tokens de raisonnement sont facturés comme des tokens de sortie, et la chaîne de raisonnement brute n’est jamais renvoyée. Avec thinking.display défini sur omitted par défaut, le champ de raisonnement affiché est vide, mais chaque token de raisonnement sous-jacent reste facturé. Consultez usage.output_tokens_details.thinking_tokens dans la réponse pour voir la répartition. En streaming, ce champ n’arrive que dans l’événement message_delta final. Réduisez le niveau effort si la proportion de raisonnement par rapport à la réponse dépasse les besoins de la tâche.
Dois-je utiliser Claude Fable 5 ou Claude Opus 5 ?
Claude Opus 5 coûte deux fois moins cher par token et dispose d’une date de coupure des connaissances fiables plus récente : mai 2026, contre janvier 2026 pour Fable 5. Commencez par Opus 5 et passez à un modèle supérieur lorsqu’une tâche échoue avec ce modèle ou lorsqu’une réponse erronée coûte plus cher que la différence de prix. Fable 5 convient aux tâches d’agent à long horizon, lorsqu’une mauvaise branche peut nécessiter plusieurs heures de nettoyage, ainsi qu’aux tâches ponctuelles dont le surcoût apparaît sur une seule facture plutôt que sur chaque requête à long terme.