Claude Fable 5: preço e quando usar
O Claude Fable 5 custa $10 por milhão de tokens de entrada e $50 de saída. Veja o impacto das tarifas e quando o modelo faz sentido nos seus jobs.
Quanto custa o Claude Fable 5?
O Claude Fable 5 custa $10 por milhão de tokens de entrada e $50 por milhão de tokens de saída na Claude API. Estas são as tarifas públicas da Anthropic, consultadas na página de preços em 3 de agosto de 2026. O ID do modelo na API é claude-fable-5. O modelo ficou geralmente disponível em 9 de junho de 2026 na Claude API, no Amazon Bedrock, no Claude Platform on AWS, no Google Cloud e no Microsoft Foundry.
The data behind this chart
[
{
"label": "Claude Fable 5",
"input": "10",
"output": "50",
"cache_read": "1",
"batch_input": "5",
"batch_output": "25"
},
{
"label": "Claude Opus 5",
"input": "5",
"output": "25",
"cache_read": "0.50",
"batch_input": "2.50",
"batch_output": "12.50"
},
{
"label": "Claude Sonnet 5 (intro rate)",
"input": "2",
"output": "10",
"cache_read": "0.20",
"batch_input": "1",
"batch_output": "5"
},
{
"label": "Claude Sonnet 5 (from 1 Sep)",
"input": "3",
"output": "15",
"cache_read": "0.30",
"batch_input": "1.50",
"batch_output": "7.50"
},
{
"label": "Claude Haiku 4.5",
"input": "1",
"output": "5",
"cache_read": "0.10",
"batch_input": "0.50",
"batch_output": "2.50"
}
]Interprete estes valores como uma escala. O Fable 5 custa o dobro do Claude Opus 5, cinco vezes a tarifa atual do Claude Sonnet 5 e dez vezes a do Claude Haiku 4.5. A proporção é igual nos dois componentes da cobrança, porque todos os modelos dessa tabela cobram a saída exatamente cinco vezes a própria tarifa de entrada. Portanto, se souber a divisão entre tokens de entrada e de saída de um trabalho, pode converter um preço noutro por multiplicação.
Uma data altera o cálculo. O Sonnet 5 está com preços introdutórios de $2 e $10 por milhão de tokens até 31 de agosto de 2026. A partir de 1 de setembro de 2026, passa a custar $3 e $15. O preço do Fable 5 não muda, por isso a diferença entre os dois diminui de cinco vezes para pouco mais de três vezes nesse dia. Se estiver a preparar um orçamento para o outono, use os valores posteriores do Sonnet.
Descontos e o único multiplicador que aumenta o custo
O cache de prompts é a maior oportunidade de redução de custos. A leitura do cache custa um décimo do preço base de entrada, ou $1 por milhão de tokens no Fable 5. A gravação no cache custa mais do que um token de entrada normal: 1.25 vezes o preço base para o cache de cinco minutos e 2 vezes o preço base para o cache de uma hora. Um cache de cinco minutos compensa após uma única leitura, e um cache de uma hora após duas leituras. Essa é toda a base para calcular o ponto de equilíbrio do cache de prompts antes de o ativar em todo o lado.
A Batch API aplica um desconto de 50% aos dois lados, portanto o processamento em lote no Fable 5 custa $5 e $25 por milhão de tokens. Os pedidos em lote são assíncronos, por isso esta opção só ajuda em tarefas que não precisam de uma resposta imediata. Os dois descontos acumulam-se, o que torna um trabalho em lote com cache barato nas duas dimensões.
A janela de contexto de 1M tokens está incluída nas tarifas padrão do Claude 4.6 e dos modelos posteriores. Não existe sobretaxa para contexto longo, por isso um pedido de 900k tokens é cobrado à mesma tarifa por token que um pedido de 9k.
O multiplicador que aumenta o valor faturado é a residência dos dados. Definir inference_geo: "us" para manter a inferência dentro dos Estados Unidos aplica um multiplicador de 1.1 a todas as categorias de tokens, incluindo leituras e gravações no cache. Mantenha o encaminhamento global predefinido, salvo quando um contrato exigir o contrário.
Existe uma regra de faturação específica deste modelo. O Fable 5 inclui classificadores de segurança que podem recusar um pedido. Quando isso acontece, a Messages API devolve stop_reason: "refusal" numa resposta HTTP 200 bem-sucedida, em vez de devolver um erro, e o pedido recusado antes de qualquer saída ser gerada não é faturado. Se repetir o mesmo prompt noutro modelo Claude, o crédito de fallback reembolsa o custo do cache de prompts da mudança, para não pagar duas vezes pelo aquecimento do mesmo cache.
Quais planos incluem o Claude Fable 5?
Em 3 de agosto de 2026, a página do Claude Fable da Anthropic informava que o modelo estava disponível para utilizadores Pro, Max, Team e Enterprise. O plano gratuito não era mencionado. O Pro é o lugar mais barato dessa lista, por isso o preço do Pro e onde os seus limites de utilização terminam define o custo mínimo de qualquer subscrição para usar o Fable. Se o acesso ao Fable for a principal razão para fazer upgrade, analise primeiro se vale a pena pagar um lugar Pro com base na sua própria utilização, porque uma franquia reduzida do Fable, por si só, não justifica bem a subscrição. Para programadores, o modelo está geralmente disponível na Claude API e através dos marketplaces de cloud listados acima. Essa opção não tem um nível gratuito, por isso o pequeno crédito que a Anthropic concede no registo é tudo o que recebe antes de a utilização começar a ser cobrada.
Estar disponível num plano não é o mesmo que estar incluído sem limite. Uma subscrição também não é medida da mesma forma que a API, porque uma licença Pro não tem qualquer quota de tokens publicada e contabiliza a utilização em mensagens ao longo de uma janela móvel. Por isso, nada num plano pode ser convertido diretamente nos valores por milhão apresentados acima. A tabela de comparação de planos na página de preços da Anthropic condiciona o acesso ao Fable a uma parte dos limites de utilização semanais em algumas licenças e a créditos de utilização noutras. Essa configuração mudou mais do que uma vez durante julho de 2026. A própria Anthropic informou, ao relançar o Fable 5, que o modelo estaria disponível até 50% dos limites de utilização semanais até 7 de julho de 2026 nos planos Pro, Max, Team e em alguns planos Enterprise, passando depois a utilizar créditos de utilização. As informações publicadas durante o restante mês de julho descreveram novas extensões e uma divisão entre tipos de licença.
Por isso, esta página não apresentará um limite por plano. Nenhum valor publicado durante esse mês permaneceu válido por duas semanas, e um número desatualizado seria pior do que não apresentar nenhum. Abra a linha identificada como Fable na tabela de comparação de planos no dia em que decidir e considere desatualizado qualquer número apresentado num artigo de notícias. Se adquirir um lugar para ter acesso ao Fable e a franquia se revelar menor do que a tabela fazia esperar, voltar para um plano inferior antes da próxima renovação mantém intacto o mês que já pagou.
O que permanece estável é a tarifa da API. Em qualquer opção, depois de esgotar a franquia incluída, a utilização adicional do Fable 5 é cobrada pelos preços apresentados no gráfico acima. O Enterprise torna essa estrutura explícita, porque a taxa do lugar Enterprise compra o acesso, mas os tokens continuam a ser cobrados às tarifas da API além desse valor. Assim, a tabela de preços é o valor a usar no planeamento em qualquer caso. Essa é também a conclusão obtida ao comparar a faturação da API com uma subscrição para qualquer outro modelo Claude. Se ainda não escolheu um nível, comece por identificar o plano Claude adequado à sua utilização. Se esse lugar também for o seu assistente diário, e não apenas uma forma de obter acesso ao Fable, vale a pena verificar como os preços dos planos Claude se comparam com os do ChatGPT antes de se comprometer.
Por que a sua fatura fica acima do que a proporção de preços sugere
Dois mecanismos documentados fazem com que o Fable 5 custe mais do que uma comparação direta de preços indica.
O primeiro é o tokenizador. O Fable 5 usa o tokenizador introduzido com o Claude Opus 4.7. Em comparação com modelos lançados antes do Opus 4.7, o mesmo texto produz aproximadamente 30% mais tokens, e o aumento exato depende do conteúdo. O Haiku 4.5 é anterior a esse tokenizador, portanto a diferença de dez vezes na tabela de preços aproxima-se de treze vezes quando os dois modelos recebem o mesmo bloco de texto. O Sonnet 5 usa o tokenizador mais recente, portanto a comparação entre Fable e Sonnet é justa por token. A comparação entre Fable e Haiku não é.
O segundo é o raciocínio. O adaptive thinking está sempre ativado no Fable 5, e thinking: {"type": "disabled"} não é compatível. Os tokens de raciocínio são faturados como tokens de saída, à tarifa integral de saída. A cadeia de raciocínio bruta nunca é devolvida por este modelo, e thinking.display assume "omitted" por predefinição, o que significa que uma resposta visível curta pode incluir uma grande quantidade de tokens de saída faturados. A documentação da Anthropic afirma isso claramente: a quantidade de tokens de saída faturados não corresponde à quantidade de tokens visíveis na resposta.
Consulte a discriminação em vez de fazer suposições. O campo usage.output_tokens_details.thinking_tokens indica quantos tokens de saída faturados foram usados para raciocínio:
{
"usage": {
"input_tokens": 25,
"output_tokens": 348,
"output_tokens_details": {
"thinking_tokens": 312
}
}
}Nesse exemplo, retirado da documentação da Anthropic sobre thinking, 312 dos 348 tokens de saída faturados foram usados para raciocínio que ninguém viu. Ao fazer streaming, esta discriminação chega apenas no evento message_delta final, portanto um cliente que pare de ler no último bloco de texto nunca a registará.
O controlo é effort, definido em output_config.effort, com os níveis low, medium, high (o predefinido), xhigh e max.
{
"model": "claude-fable-5",
"max_tokens": 32000,
"output_config": { "effort": "medium" },
"messages": [{ "role": "user", "content": "..." }]
}A orientação da Anthropic para este modelo é começar em high, subir para xhigh apenas no trabalho mais sensível às capacidades e descer para medium ou low no trabalho de rotina, porque um esforço menor no Fable 5 muitas vezes supera xhigh em modelos anteriores. Há duas armadilhas. Alterar o esforço entre pedidos invalida a cache de prompts, porque o valor de esforço resolvido é incluído no prompt. Por isso, escolha um nível por carga de trabalho e mantenha-o constante. Além disso, max_tokens é um limite rígido para a saída total, combinando o raciocínio e o texto da resposta. Um limite dimensionado para uma resposta sem raciocínio pode truncar a saída. Ver stop_reason: "max_tokens" significa que deve aumentar o limite ou reduzir o esforço.
Custo por tarefa concluída, não custo por token
The data behind this chart
[
{
"label": "Short answer (5k in, 1k out)",
"fable_5": "0.10",
"opus_5": "0.05",
"sonnet_5": "0.02",
"haiku_4_5": "0.01"
},
{
"label": "Coding session (300k in, 40k out)",
"fable_5": "5.00",
"opus_5": "2.50",
"sonnet_5": "1.00",
"haiku_4_5": "0.50"
},
{
"label": "Long agent run (2M in, 400k out)",
"fable_5": "40.00",
"opus_5": "20.00",
"sonnet_5": "8.00",
"haiku_4_5": "4.00"
}
]As 3 linhas são cálculos aritméticos, não um benchmark. As tarifas são públicas. Os volumes de tokens são pressupostos que deve substituir por valores dos seus próprios dados de utilização. Uma sessão de programação com um perfil semelhante ao da linha intermédia custa $5.00 com Fable 5, contra $1.00 com Sonnet 5. A execução longa custa $40.00, contra $8.00. O valor de Haiku na última linha é apenas um cálculo aritmético: Haiku 4.5 tem uma janela de contexto de 200k tokens, por isso não consegue conter essa tarefa.
Custo por token é a unidade errada para tomar uma decisão. O custo por tarefa concluída é o custo por tentativa multiplicado pelo número de tentativas. Com as tarifas atuais, uma tentativa com Fable 5 custa o mesmo que cinco tentativas com Sonnet 5, por isso o número de novas tentativas, por si só, quase nunca justifica a atualização. Sonnet teria de falhar mais de quatro vezes em cinco para a opção mais barata deixar de compensar em tokens.
O que justifica a escolha são todos os fatores que a fatura de tokens não inclui. A diferença entre as duas execuções longas no gráfico é inferior a uma hora do tempo de um engenheiro na maioria dos mercados. Se o modelo mais caro poupar uma hora de revisão ou evitar uma migração incorreta que depois tenha de desfazer, já se pagou a si próprio através de uma fatura que não mostra essa poupança. Faça a comparação em dinheiro por resultado aceite e inclua o seu próprio tempo no total. Saber quanto compram realmente um milhão de tokens torna essa estimativa muito menos abstrata.
Três tarefas em que o Claude Fable 5 compensa o preço
Execuções de agentes com horizonte longo, em que um desvio é dispendioso. O Fable 5 foi criado para trabalho medido em horas: uma janela de contexto de 1M tokens, até 128k tokens de saída por pedido e um nível de esforço xhigh orientado para tarefas com duração superior a trinta minutos e orçamentos de milhões de tokens. Compare o custo da execução com o trabalho de limpeza necessário depois de um agente seguir um ramo errado no passo 40, sem que ninguém o detete até ao passo 300.
Uma migração ou auditoria executada uma única vez num código-fonte extenso. O trabalho pontual não tem volume suficiente para amortizar o custo. Por isso, o preço adicional por token incide numa única fatura, e todo o trabalho pode caber numa única janela de contexto. Se puder ser executado de forma assíncrona, a Batch API reduz o custo para metade: $25 por milhão de tokens de saída.
A tarefa em que um modelo mais barato já falhou duas vezes. Duas tentativas falhadas, somadas ao tempo de depuração, custam mais do que uma tentativa com o Fable nos volumes apresentados no gráfico acima. Escalar é a opção mais barata. É essa a finalidade de uma hierarquia de modelos. Se ainda está a escolher entre níveis de forma geral, a comparação de capacidades entre os níveis de modelos Claude responde a uma pergunta diferente da desta página.
Três tarefas em que Sonnet 5 ou Haiku 4.5 são a resposta correta
Classificação e extração em grande volume. Estas tarefas são avaliadas pelo throughput e pelo custo unitário, e o limite de qualidade é suficientemente baixo para que um modelo barato o atinja. A dez vezes o preço de uma tarefa que Haiku 4.5 conclui corretamente, Fable 5 não oferece qualquer benefício mensurável.
Trabalho interativo em que a latência é o produto. A tabela de modelos da Anthropic indica que a latência comparativa de Fable 5 é mais alta, e o raciocínio não pode ser desativado. Uma caixa de chat ou uma conclusão num editor proporciona uma experiência pior com o modelo mais capaz, porque os utilizadores reparam na espera antes de repararem na qualidade.
Qualquer tarefa que dependa de eventos posteriores a January 2026. O limite de conhecimento fiável de Fable 5 é January 2026. O de Opus 5 é May 2026. O modelo mais caro é o menos atual, portanto, em perguntas sobre atualidade, paga o dobro por conhecimento mais antigo, a menos que lhe forneça ferramentas de pesquisa ou obtenção de dados.
Há uma limitação que não está relacionada com o custo. Fable 5 mantém os dados durante 30 day e não está disponível com zero retenção de dados, porque é designado como Covered Model. Se o seu contrato exigir zero retenção, Fable 5 não é uma opção a qualquer preço, e nenhum desconto altera essa condição.
O que os repositórios do método fable mostram e o que não mostram
Praticantes publicaram repositórios que condensam a forma como as abordagens Fable 5 funcionam em competências que um modelo mais barato consegue seguir. O repositório fable-method descreve uma competência de raciocínio, um ciclo de orquestração e um verificador adversarial que repete todas as verificações alegadas, em vez de ler o próprio relatório do agente. O README afirma isso diretamente: "Esta é uma condensação da comunidade, não um artefacto da Anthropic."
Trate-o exatamente como tal. É uma evidência de como as pessoas estão a conduzir o modelo, não uma documentação de como o modelo funciona. Nada nele foi validado pela Anthropic, e existem vários forks quase idênticos com redações diferentes. É o que seria de esperar de uma tradição oral, não de uma especificação.
O sinal relevante para uma decisão de custo é que as partes que as pessoas consideraram dignas de copiar são procedimentais. Classifique a tarefa, indique a verificação que prova que está concluída, recolha evidências antes de decidir e confirme por observação, em vez de ler um resumo. Um modelo mais barato ao qual seja fornecida uma checklist explícita e uma etapa de verificação consegue reduzir parte da diferença. Por isso, execute essa experiência no seu próprio conjunto de avaliação antes de normalizar a utilização do modelo mais caro. O resultado depende das suas tarefas. É por isso que o número de outra pessoa tem pouco valor para si.
Verifique os seus próprios valores antes de comprometer o orçamento
- Leia
usageem cada resposta e registeoutput_tokens_details.thinking_tokensseparadamente da saída visível. O raciocínio que nunca vê é o item de custo que costuma surpreender. - Defina
effortexplicitamente em vez de aceitar o valor predefinido e mantenha-o constante em qualquer conversa que dependa de caching de prompts. - Coloque primeiro o seu prefixo estável atrás de um ponto de cache. Uma leitura da cache a um décimo do preço da entrada base poupa mais do que a maioria das mudanças para modelos inferiores.
- Transfira para a Batch API tudo o que não precise de uma resposta imediata.
- Calcule o preço da alternativa de forma realista. Comparar os preços das APIs Claude e ChatGPT na sua própria carga de trabalho vale uma tarde antes de assumir um compromisso prolongado.
Se a carga de trabalho for um agente executado no seu próprio servidor, os controlos mais importantes estão fora da escolha do modelo. Manter os custos de um agente sob controlo num VPS aborda os limites do ciclo e os limites de despesa que impedem uma sessão descontrolada, e onde o Claude Code gasta realmente tokens explica os valores que verá no seu painel de utilização.
FAQ
Quanto custa o Claude Fable 5 por milhão de tokens?
O Claude Fable 5 custa $10 por milhão de tokens de entrada e $50 por milhão de tokens de saída na API do Claude, de acordo com a página de preços da Anthropic consultada em 3 August 2026. Uma leitura da cache custa $1 por milhão de tokens, um décimo da tarifa base de entrada. A Batch API aplica um desconto de 50% a ambos os lados, resultando em $5 e $25 por milhão de tokens para trabalho assíncrono. Manter a inferência dentro dos Estados Unidos com o parâmetro inference_geo acrescenta um multiplicador de 1.1 a todas as categorias.
O Claude Fable 5 está incluído numa subscrição Claude Pro?
A página do Claude Fable da Anthropic indica que o modelo está disponível para utilizadores Pro, Max, Team e Enterprise, mas não menciona o plano gratuito. O acesso incluído não é ilimitado. Algumas licenças permitem utilizar o Fable como parte dos limites semanais de utilização, enquanto outras recorrem a créditos de utilização. Essa modalidade mudou mais de uma vez durante July 2026. Consulte a linha identificada como Fable na tabela de comparação de planos da página de preços da Anthropic no dia em que tomar a decisão, em vez de confiar num valor indicado num artigo. Quando o limite incluído é esgotado, a utilização adicional é faturada à tarifa da API.
Porque é que a minha fatura do Claude Fable 5 é superior ao que a saída visível sugere?
O adaptive thinking está sempre ativo no Claude Fable 5, os tokens de raciocínio são faturados como tokens de saída e a cadeia de raciocínio bruta nunca é devolvida. Com thinking.display no valor predefinido de omitted, vê um campo de raciocínio vazio, mas paga por todos os tokens de raciocínio gerados internamente. Leia usage.output_tokens_details.thinking_tokens na resposta para ver a separação e tenha em conta que, durante o streaming, esse campo só chega no evento final message_delta. Reduza o nível effort se a proporção entre raciocínio e resposta for superior ao necessário para a tarefa.
Devo usar o Claude Fable 5 ou o Claude Opus 5?
O Claude Opus 5 custa metade por token e tem um limite de conhecimento fiável mais recente: May 2026, contra January 2026 no Fable 5. Comece pelo Opus 5 e recorra ao Fable quando uma tarefa falhar no Opus ou quando o custo de uma resposta errada for superior à diferença de preço. O Fable 5 é a escolha adequada para trabalho de agentes com horizontes longos, em que uma ramificação incorreta exige horas de correções, e para tarefas pontuais cujo custo adicional aparece numa única fatura, em vez de incidir sobre todos os pedidos de forma permanente.