Claude Fable 5 : prix et cas d’usage
Claude Fable 5 coûte 10 $ par million de tokens en entrée et 50 $ en sortie. Découvrez ce que ces tarifs Anthropic impliquent pour vos tâches réelles.
Quel est le coût de Claude Fable 5 ?
Claude Fable 5 coûte $10 par million de tokens en entrée et $50 par million de tokens en sortie sur l’API Claude. Il s’agit des tarifs catalogue publiés par Anthropic, relevés sur la page de tarification le 3 August 2026. L’identifiant de modèle de l’API est claude-fable-5. Le modèle est devenu généralement disponible le 9 June 2026 sur l’API Claude, Amazon Bedrock, Claude Platform on AWS, Google Cloud et Microsoft Foundry.
The data behind this chart
[
{
"label": "Claude Fable 5",
"input": "10",
"output": "50",
"cache_read": "1",
"batch_input": "5",
"batch_output": "25"
},
{
"label": "Claude Opus 5",
"input": "5",
"output": "25",
"cache_read": "0.50",
"batch_input": "2.50",
"batch_output": "12.50"
},
{
"label": "Claude Sonnet 5 (intro rate)",
"input": "2",
"output": "10",
"cache_read": "0.20",
"batch_input": "1",
"batch_output": "5"
},
{
"label": "Claude Sonnet 5 (from 1 Sep)",
"input": "3",
"output": "15",
"cache_read": "0.30",
"batch_input": "1.50",
"batch_output": "7.50"
},
{
"label": "Claude Haiku 4.5",
"input": "1",
"output": "5",
"cache_read": "0.10",
"batch_input": "0.50",
"batch_output": "2.50"
}
]Considérez ces tarifs comme une échelle. Fable 5 est affiché à deux fois le prix de Claude Opus 5, à cinq fois le tarif actuel de Claude Sonnet 5 et à dix fois celui de Claude Haiku 4.5. Le ratio est identique pour les entrées et les sorties, car chaque modèle de ce tableau facture les sorties exactement cinq fois son propre tarif d’entrée. Si vous connaissez la répartition des tokens d’entrée et de sortie d’une tâche, vous pouvez convertir un prix vers n’importe quel autre par multiplication.
Une date modifie le calcul. Sonnet 5 bénéficie d’un tarif de lancement de $2 et $10 par million de tokens jusqu’au 31 August 2026. À partir du 1 September 2026, son tarif catalogue sera de $3 et $15. Le prix de Fable 5 ne change pas. L’écart entre les deux modèles passe donc de cinq fois à un peu plus de trois fois ce jour-là. Si vous préparez un budget pour l’automne, utilisez les tarifs Sonnet les plus récents.
Les remises et le seul multiplicateur qui augmente la facture
La mise en cache des prompts est le levier le plus important. La lecture du cache coûte un dixième du tarif de base, soit $1 par million de tokens avec Fable 5. L’écriture dans le cache coûte plus cher qu’un token d’entrée ordinaire : 1.25 fois le tarif de base pour le cache de cinq minutes et 2 fois le tarif de base pour le cache d’une heure. Un cache de cinq minutes est amorti dès la première lecture, et un cache d’une heure après deux lectures. Ce calcul suffit à justifier le calcul du seuil de rentabilité de la mise en cache des prompts avant de l’activer partout.
La Batch API applique une remise de 50 % aux entrées comme aux sorties. Un traitement Fable 5 groupé coûte donc $5 et $25 par million de tokens. Les requêtes Batch sont asynchrones. Cette option convient donc uniquement aux traitements qui ne nécessitent pas de réponse immédiate. Les deux remises se cumulent, ce qui rend les traitements groupés et mis en cache peu coûteux sur les deux axes.
La fenêtre de contexte de 1M tokens est incluse au tarif standard avec Claude 4.6 et les modèles ultérieurs. Aucun supplément ne s’applique aux contextes longs. Une requête de 900k tokens est donc facturée au même tarif par token qu’une requête de 9k tokens.
Le multiplicateur qui augmente la facture concerne la résidence des données. Définir inference_geo: "us" pour maintenir l’inférence aux États-Unis applique un multiplicateur de 1.1 à chaque catégorie de tokens, y compris les lectures et les écritures du cache. Conservez le routage global par défaut, sauf si un contrat impose une autre configuration.
Une règle de facturation est propre à ce modèle. Fable 5 intègre des classificateurs de sécurité qui peuvent refuser une requête. Dans ce cas, la Messages API renvoie stop_reason: "refusal" avec une réponse HTTP 200 indiquant une réussite, et aucun frais n’est facturé pour une requête refusée avant la génération de toute sortie. Si vous réessayez le même prompt avec un autre modèle Claude, le crédit de fallback rembourse le coût de la mise en cache du prompt lié au changement. Vous ne payez donc pas deux fois pour remplir le même cache.
Quels forfaits incluent Claude Fable 5 ?
Au 3 août 2026, la page Claude Fable d’Anthropic indique que le modèle est disponible pour les utilisateurs Pro, Max, Team et Enterprise. Le forfait gratuit n’est pas mentionné. Pro est le siège le moins cher de cette liste. le prix de Pro et les limites d’utilisation qui s’appliquent constituent donc le seuil minimal de toute souscription donnant accès à Fable. Pour les développeurs, le modèle est généralement disponible sur l’API Claude et via les cloud marketplaces listés plus haut. Cette voie ne propose aucun free tier. le petit crédit accordé par Anthropic lors de l’inscription est donc le seul avantage disponible avant le début de la facturation à l’usage.
La disponibilité dans un forfait ne signifie pas que l’utilisation est illimitée. Le tableau comparatif des forfaits sur la page de tarification d’Anthropic limite l’accès à Fable à une part des limites d’utilisation hebdomadaires pour certains sièges, et à des usage credits pour d’autres. Cette organisation a changé plusieurs fois en juillet 2026. Dans sa propre communication sur le redéploiement de Fable 5, Anthropic indiquait que le modèle était disponible dans la limite de 50 % des limites d’utilisation hebdomadaires jusqu’au 7 juillet 2026 pour les forfaits Pro, Max, Team et certains forfaits Enterprise, puis avec des usage credits. Les informations publiées pendant le reste du mois de juillet faisaient état de nouvelles prolongations et d’une distinction entre les types de sièges.
Cette page n’indiquera donc pas de limite par forfait. Aucun chiffre publié pendant ce mois n’est resté valable deux semaines, et un nombre obsolète serait pire que l’absence de chiffre. Consultez la ligne Fable du tableau comparatif des forfaits le jour où vous prenez votre décision, et considérez tout nombre indiqué dans un article d’actualité comme obsolète. Si vous prenez un siège pour accéder à Fable et que l’allocation s’avère inférieure à ce que le tableau laissait prévoir, revenir à un forfait inférieur avant le prochain renouvellement vous permet de conserver le mois déjà payé.
Le tarif API, lui, reste stable. Quelle que soit la voie utilisée, une fois l’allocation incluse épuisée, l’utilisation supplémentaire de Fable 5 est facturée aux tarifs indiqués dans le tableau ci-dessus. Enterprise rend cette structure explicite, car les frais du siège Enterprise donnent accès au service, tandis que les tokens restent facturés aux tarifs API en supplément. Dans tous les cas, il faut donc prendre la grille tarifaire comme base de calcul. C’est la même conclusion que celle obtenue en comparant la facturation API à une souscription pour tout autre modèle Claude. Si vous n’avez pas encore choisi de niveau, commencez par le forfait Claude adapté à votre usage. Si ce siège doit aussi servir d’assistant quotidien, et pas seulement donner accès à Fable, vérifiez comment les forfaits Claude se comparent à ceux de ChatGPT avant de vous engager.
Pourquoi votre facture dépasse le ratio de prix attendu
Deux mécanismes documentés expliquent pourquoi Fable 5 coûte plus cher que ne le laisse penser une simple comparaison des prix.
Le premier est le tokenizer. Fable 5 utilise le tokenizer introduit avec Claude Opus 4.7. Par rapport aux modèles sortis avant Opus 4.7, un même texte produit environ 30% de tokens supplémentaires, avec une hausse exacte qui dépend du contenu. Haiku 4.5 utilise l’ancien tokenizer. L’écart de prix de dix fois indiqué dans la grille correspond donc plutôt à treize fois lorsque vous envoyez le même bloc de texte aux deux modèles. Sonnet 5 utilise le nouveau tokenizer. La comparaison du prix par token avec Sonnet est donc pertinente. Elle ne l’est pas avec Haiku.
Le second mécanisme est le thinking. Le thinking adaptatif est toujours activé pour Fable 5 et thinking: {"type": "disabled"} n’est pas pris en charge. Les tokens de thinking sont facturés comme des tokens de sortie, au tarif de sortie complet. La chaîne de raisonnement brute n’est jamais renvoyée par ce modèle, et thinking.display prend par défaut la valeur "omitted". Une réponse visible courte peut donc correspondre à un nombre élevé de tokens de sortie facturés. La documentation d’Anthropic l’indique clairement : le nombre de tokens de sortie facturés ne correspond pas au nombre de tokens visibles dans la réponse.
Consultez le détail au lieu de deviner. Le champ usage.output_tokens_details.thinking_tokens indique combien de tokens de sortie facturés ont été consacrés au raisonnement :
{
"usage": {
"input_tokens": 25,
"output_tokens": 348,
"output_tokens_details": {
"thinking_tokens": 312
}
}
}Dans cet exemple, tiré de la documentation d’Anthropic sur le thinking, 312 des 348 tokens de sortie facturés correspondaient à un raisonnement que personne n’a jamais vu. En streaming, ce détail n’arrive que dans l’événement message_delta final. Un client qui cesse de lire après le dernier bloc de texte ne l’enregistrera donc jamais.
Le paramètre de contrôle est effort. Il est défini à output_config.effort et accepte les niveaux low, medium, high (valeur par défaut), xhigh et max.
{
"model": "claude-fable-5",
"max_tokens": 32000,
"output_config": { "effort": "medium" },
"messages": [{ "role": "user", "content": "..." }]
}Anthropic recommande pour ce modèle de commencer à high, de passer à xhigh uniquement pour les tâches les plus sensibles aux capacités, puis de redescendre à medium ou low pour les tâches courantes. Selon Anthropic, un effort plus faible avec Fable 5 donne souvent de meilleurs résultats que xhigh avec les modèles précédents. Deux pièges sont à prendre en compte. Modifier le niveau d’effort entre deux requêtes invalide votre prompt cache, car la valeur d’effort résolue est intégrée au prompt. Choisissez donc un niveau par type de charge et conservez-le. De plus, max_tokens impose une limite stricte à la sortie totale, qui comprend le thinking et le texte de réponse. Une limite adaptée à une réponse sans thinking entraînera donc une troncature. Si vous voyez stop_reason: "max_tokens", augmentez la limite ou réduisez l’effort.
Coût par tâche terminée, et non coût par token
The data behind this chart
[
{
"label": "Short answer (5k in, 1k out)",
"fable_5": "0.10",
"opus_5": "0.05",
"sonnet_5": "0.02",
"haiku_4_5": "0.01"
},
{
"label": "Coding session (300k in, 40k out)",
"fable_5": "5.00",
"opus_5": "2.50",
"sonnet_5": "1.00",
"haiku_4_5": "0.50"
},
{
"label": "Long agent run (2M in, 400k out)",
"fable_5": "40.00",
"opus_5": "20.00",
"sonnet_5": "8.00",
"haiku_4_5": "4.00"
}
]Ces lignes 3 relèvent de l’arithmétique, et non d’un benchmark. Les tarifs sont publiés. Les volumes de tokens sont des hypothèses que vous devez remplacer par des chiffres issus de vos propres données d’utilisation. Une session de code comparable à la ligne intermédiaire coûte $5.00 avec Fable 5, contre $1.00 avec Sonnet 5. La longue exécution coûte $40.00, contre $8.00. La colonne Haiku de cette dernière ligne relève uniquement de l’arithmétique : Haiku 4.5 dispose d’une fenêtre de contexte de 200k tokens et ne peut donc pas contenir cette tâche.
Le coût par token n’est pas la bonne unité pour prendre une décision. Le coût par tâche terminée correspond au coût d’une tentative multiplié par le nombre de tentatives. Aux tarifs actuels, une tentative avec Fable 5 coûte autant que cinq tentatives avec Sonnet 5. Le seul nombre de nouvelles tentatives ne justifie donc presque jamais la mise à niveau. Sonnet devrait échouer plus de quatre fois sur cinq pour que l’option économique devienne plus coûteuse en tokens.
Ce qui justifie cette dépense, c’est tout ce que la facture de tokens ne prend pas en compte. Dans la plupart des marchés, l’écart entre les deux longues exécutions du graphique est inférieur au coût d’une heure de travail d’un ingénieur. Si le modèle le plus cher vous fait économiser une heure de revue ou vous évite une migration incorrecte que vous devriez ensuite annuler, il a déjà couvert son coût, même si la facture ne fait pas apparaître cette économie. Faites la comparaison en coût par résultat accepté et incluez votre propre temps dans le total. Comprendre ce qu’achètent réellement un million de tokens rend cette estimation beaucoup moins abstraite.
Trois tâches pour lesquelles Claude Fable 5 justifie son prix
Les exécutions d’agent de longue durée, lorsqu’une mauvaise direction coûte cher. Fable 5 est conçu pour les tâches qui se mesurent en heures : une fenêtre de contexte de 1M tokens, jusqu’à 128k tokens de sortie par requête et un niveau d’effort xhigh destiné aux tâches de plus de trente minutes, avec des budgets de plusieurs millions de tokens. Comparez le coût de l’exécution avec celui du nettoyage nécessaire après qu’un agent a pris une mauvaise branche à l’étape 40, sans que personne ne s’en aperçoive avant l’étape 300.
Une migration ou un audit exécuté une seule fois sur une base de code volumineuse. Un travail ponctuel ne permet pas d’amortir les coûts par le volume. La majoration par token apparaît donc sur une seule facture, et l’ensemble de la tâche peut tenir dans une seule fenêtre de contexte. Si l’exécution peut être asynchrone, la Batch API divise ce coût par deux, à $25 par million de tokens de sortie.
La tâche qu’un modèle moins cher a déjà échoué à exécuter deux fois. Deux tentatives échouées, auxquelles s’ajoute votre temps de débogage, coûtent plus cher qu’une tentative avec Fable aux volumes indiqués dans le graphique ci-dessus. Passer au niveau supérieur est l’option la moins chère : c’est précisément le rôle d’une hiérarchie de modèles. Si vous hésitez encore entre plusieurs niveaux de manière générale, la comparaison des capacités entre les niveaux de modèles Claude répond à une question différente de celle traitée sur cette page.
Trois tâches pour lesquelles Sonnet 5 ou Haiku 4.5 est le choix honnête
Classification et extraction à haut volume. Ces tâches sont évaluées sur le débit et le coût unitaire, et leur niveau de qualité maximal est suffisamment bas pour qu’un modèle peu coûteux l’atteigne. Pour une tâche que Haiku 4.5 réalise correctement, payer dix fois plus cher pour Fable 5 n’apporte aucun gain mesurable.
Travail interactif où la latence fait partie du produit. Le tableau des modèles d’Anthropic indique que la latence comparative de Fable 5 est plus élevée, et il est impossible de désactiver le mode de raisonnement. Une interface de chat ou la complétion dans un éditeur donne une moins bonne expérience avec le modèle le plus capable, car les utilisateurs remarquent l’attente avant de remarquer la qualité.
Toute tâche qui dépend d’événements postérieurs à janvier 2026. La date limite de connaissance fiable de Fable 5 est janvier 2026. Celle d’Opus 5 est mai 2026. Le modèle le plus cher est le moins à jour. Pour les questions d’actualité, vous payez donc deux fois plus cher pour des connaissances plus anciennes, sauf si vous lui fournissez des outils de recherche ou de récupération.
Une contrainte est totalement indépendante du coût. Fable 5 conserve les données pendant 30 jours et n’est pas disponible avec une conservation nulle des données, car il est désigné comme Covered Model. Si votre contrat impose une conservation nulle, Fable 5 n’est pas une option, quel que soit son prix, et aucune remise ne change cette règle.
Ce que montrent les dépôts fable-method, et ce qu’ils ne montrent pas
Des praticiens ont publié des dépôts qui synthétisent les méthodes de travail de Fable 5 sous forme de compétences qu’un modèle moins coûteux peut appliquer. Le dépôt fable-method décrit une compétence de raisonnement, une boucle d’orchestration et un vérificateur adversarial qui réexécute chaque contrôle revendiqué au lieu de se fier au propre rapport de l’agent. Son README l’indique directement : « Il s’agit d’une synthèse communautaire, pas d’un artefact d’Anthropic. »
Considérez-le exactement comme tel. Il montre comment des utilisateurs pilotent le modèle, mais ne documente pas son fonctionnement interne. Rien dans ce dépôt n’a été validé par Anthropic. Plusieurs forks presque identiques existent avec des formulations différentes, ce qui correspond davantage à une tradition orale qu’à une spécification.
Pour prendre une décision de coût, le signal important est que les éléments que les utilisateurs ont jugé utile de copier sont procéduraux. Classifiez la tâche, indiquez le contrôle qui prouve qu’elle est terminée, rassemblez les éléments de preuve avant de décider, puis vérifiez par observation plutôt qu’en lisant un résumé. Un modèle moins coûteux auquel vous fournissez une checklist explicite et une étape de vérification peut réduire une partie de l’écart. Faites donc cette expérience sur votre propre jeu d’évaluation avant de standardiser l’utilisation du modèle plus coûteux. Le résultat dépend de vos tâches. C’est pourquoi le chiffre obtenu par quelqu’un d’autre a peu de valeur pour vous.
Vérifiez vos propres chiffres avant d’engager un budget
- Lisez
usagedans chaque réponse et consignezoutput_tokens_details.thinking_tokensséparément de la sortie visible. Le raisonnement que vous ne voyez jamais est le poste qui réserve les mauvaises surprises. - Définissez explicitement
effortau lieu d’accepter la valeur par défaut, et conservez cette valeur pendant toute conversation qui repose sur le prompt caching. - Placez d’abord votre préfixe stable derrière un cache breakpoint. Une lecture depuis le cache à un dixième du prix de l’entrée de base permet d’économiser davantage que la plupart des changements vers un modèle moins cher.
- Déplacez vers la Batch API tout ce qui ne nécessite pas de réponse immédiate.
- Évaluez honnêtement l’alternative. Comparer les tarifs des API Claude et ChatGPT sur votre propre charge de travail vaut un après-midi avant tout engagement de longue durée.
Si la charge de travail correspond à un agent exécuté sur votre propre serveur, les contrôles les plus importants ne concernent pas le choix du modèle. Maîtriser les coûts d’un agent sur un VPS présente les limites de boucle et les plafonds de dépenses qui interrompent une session hors de contrôle, tandis que où Claude Code dépense réellement ses tokens explique les chiffres affichés dans votre tableau de bord d’utilisation.
FAQ
Combien coûte Claude Fable 5 par million de tokens ?
Claude Fable 5 est facturé $10 par million de tokens d’entrée et $50 par million de tokens de sortie sur l’API Claude, selon les tarifs publiés par Anthropic le 3 août 2026. La lecture du cache coûte $1 par million de tokens, soit un dixième du tarif de base des tokens d’entrée. La Batch API réduit de 50 % les deux tarifs, qui passent à $5 et $25 par million de tokens pour les traitements asynchrones. Le fait de maintenir l’inférence aux États-Unis avec le paramètre inference_geo ajoute un multiplicateur de 1.1 à chaque catégorie.
Claude Fable 5 est-il inclus dans un abonnement Claude Pro ?
La page Claude Fable d’Anthropic indique que le modèle est disponible pour les utilisateurs Pro, Max, Team et Enterprise, sans mentionner l’offre gratuite. L’accès inclus n’est pas illimité. Certains sièges donnent accès à Fable dans le cadre des limites d’utilisation hebdomadaires, tandis que d’autres y donnent accès au moyen de crédits d’utilisation. Cette organisation a changé plusieurs fois en juillet 2026. Consultez la ligne Fable du tableau comparatif des offres sur la page des tarifs d’Anthropic le jour où vous prenez votre décision, au lieu de vous fier au chiffre indiqué dans un article. Une fois le quota inclus épuisé, l’utilisation supplémentaire est facturée au tarif de l’API.
Pourquoi ma facture Claude Fable 5 est-elle plus élevée que ne le laisse penser la sortie visible ?
Le raisonnement adaptatif est toujours activé pour Claude Fable 5. Les tokens de raisonnement sont facturés comme des tokens de sortie, et la chaîne de pensée brute n’est jamais renvoyée. Avec thinking.display défini sur sa valeur par défaut omitted, vous voyez un champ de raisonnement vide, tout en payant chaque token de raisonnement généré en arrière-plan. Consultez usage.output_tokens_details.thinking_tokens dans la réponse pour voir le détail, et notez qu’en streaming, cet élément n’arrive que dans l’événement final message_delta. Réduisez le niveau effort si le ratio entre le raisonnement et la réponse est supérieur à ce que la tâche exige.
Dois-je utiliser Claude Fable 5 ou Claude Opus 5 ?
Claude Opus 5 coûte moitié moins cher par token et dispose d’une date de coupure des connaissances fiables plus récente : mai 2026, contre janvier 2026 pour Fable 5. Commencez par Opus 5 et passez à Fable lorsqu’une tâche échoue avec Opus, ou lorsqu’une réponse incorrecte coûte plus cher que la différence de tarif. Fable 5 est le choix adapté aux tâches d’agent à long horizon, lorsqu’une mauvaise branche peut nécessiter plusieurs heures de nettoyage, ainsi qu’aux tâches ponctuelles dont le surcoût apparaît sur une seule facture au lieu de s’appliquer indéfiniment à chaque requête.