SSD Nodes Learn 🎉 VPS desde $4.99/mês
Guias Matt ConnorPor Matt Connor

Claude Fable 5: preço e quando usar

O Claude Fable 5 custa US$10 por milhão de tokens de entrada e US$50 de saída. Veja o que essas tarifas significam para suas tarefas reais.

Quanto custa o Claude Fable 5?

O Claude Fable 5 custa $10 por milhão de tokens de entrada e $50 por milhão de tokens de saída na Claude API. Estas são as tarifas públicas da Anthropic, consultadas na página de preços em 3 August 2026. O ID do modelo na API é claude-fable-5. O modelo ficou geralmente disponível em 9 June 2026 na Claude API, no Amazon Bedrock, no Claude Platform on AWS, no Google Cloud e no Microsoft Foundry.

ChartPublished Claude API list prices, US dollars per million tokens, checked 3 August 2026
The data behind this chart
[
  {
    "label": "Claude Fable 5",
    "input": "10",
    "output": "50",
    "cache_read": "1",
    "batch_input": "5",
    "batch_output": "25"
  },
  {
    "label": "Claude Opus 5",
    "input": "5",
    "output": "25",
    "cache_read": "0.50",
    "batch_input": "2.50",
    "batch_output": "12.50"
  },
  {
    "label": "Claude Sonnet 5 (intro rate)",
    "input": "2",
    "output": "10",
    "cache_read": "0.20",
    "batch_input": "1",
    "batch_output": "5"
  },
  {
    "label": "Claude Sonnet 5 (from 1 Sep)",
    "input": "3",
    "output": "15",
    "cache_read": "0.30",
    "batch_input": "1.50",
    "batch_output": "7.50"
  },
  {
    "label": "Claude Haiku 4.5",
    "input": "1",
    "output": "5",
    "cache_read": "0.10",
    "batch_input": "0.50",
    "batch_output": "2.50"
  }
]

Considere estes valores como uma escala. O Fable 5 custa o dobro do Claude Opus 5, cinco vezes a tarifa atual do Claude Sonnet 5 e dez vezes a do Claude Haiku 4.5. A proporção é igual nos dois componentes da cobrança, porque todos os modelos desse quadro cobram a saída exatamente cinco vezes a respetiva tarifa de entrada. Assim, se souber a divisão entre tokens de entrada e de saída de um trabalho, pode converter um preço noutro por multiplicação.

Uma data altera os cálculos. O Sonnet 5 está sujeito a preços introdutórios de $2 e $10 por milhão de tokens até 31 August 2026. A partir de 1 September 2026, passa a custar $3 e $15. O preço do Fable 5 não muda, por isso a diferença entre os dois diminui de cinco vezes para pouco mais de três vezes nesse dia. Se estiver a preparar um orçamento para o outono, use os valores posteriores do Sonnet.

Os descontos e o único multiplicador que aumenta o custo

O cache de prompts é o fator com maior impacto. A leitura do cache custa um décimo do preço base de entrada, ou $1 por milhão de tokens no Fable 5. A escrita no cache custa mais do que um token de entrada normal: 1.25 vezes o preço base no cache de cinco minutos e 2 vezes no cache de uma hora. Um cache de cinco minutos compensa após uma única leitura, e um cache de uma hora após duas leituras. Esse cálculo é todo o argumento para calcular quando o cache de prompts começa a compensar antes de o ativar em todo o lado.

A Batch API aplica um desconto de 50% aos dois lados, por isso o trabalho em lote no Fable 5 custa $5 e $25 por milhão de tokens. Os pedidos Batch são assíncronos, por isso isto só ajuda em trabalhos que não precisam de uma resposta imediata. Os dois descontos acumulam-se, o que torna um trabalho em lote com cache barato nos dois componentes.

A janela de contexto de 1M tokens está incluída nas tarifas padrão no Claude 4.6 e nos modelos posteriores. Não existe sobretaxa para contexto longo, por isso um pedido de 900k tokens é faturado à mesma tarifa por token que um pedido de 9k.

O multiplicador que aumenta a fatura é a residência dos dados. Definir inference_geo: "us" para manter a inferência nos Estados Unidos aplica um multiplicador de 1.1 vezes a todas as categorias de tokens, incluindo leituras e escritas no cache. Mantenha o encaminhamento global predefinido, exceto quando um contrato exigir o contrário.

Existe uma regra de faturação específica deste modelo. O Fable 5 inclui classificadores de segurança que podem recusar um pedido. Quando isso acontece, a Messages API devolve stop_reason: "refusal" como uma resposta HTTP 200 bem-sucedida, em vez de um erro, e não é cobrado um pedido recusado antes de ser gerada qualquer saída. Se repetir o mesmo prompt noutro modelo Claude, o crédito de fallback reembolsa o custo do cache de prompts associado à mudança, para que não pague duas vezes para aquecer o mesmo cache.

Quais planos incluem o Claude Fable 5?

Em 3 de agosto de 2026, a página do Claude Fable da Anthropic indica que o modelo está disponível para utilizadores Pro, Max, Team e Enterprise. O plano gratuito não é mencionado. Para programadores, o modelo está geralmente disponível através da Claude API e dos marketplaces de cloud listados acima.

Estar disponível num plano não significa estar incluído sem limite. A tabela de comparação de planos na página de preços da Anthropic limita o Fable a uma parte dos limites semanais de utilização em alguns tipos de conta e a créditos de utilização noutros. Essa configuração mudou mais do que uma vez durante julho de 2026. A declaração da própria Anthropic sobre a reimplementação do Fable 5 incluía o modelo até 50% dos limites semanais de utilização até 7 de julho de 2026 nos planos Pro, Max, Team e em alguns planos Enterprise, com créditos de utilização depois dessa data. As informações publicadas no restante mês de julho descreveram novas extensões e uma separação entre tipos de conta.

Por isso, esta página não apresenta um limite por plano. Nenhum valor publicado durante esse mês permaneceu válido durante duas semanas, e apresentar aqui um número desatualizado seria pior do que não apresentar nenhum. Abra a linha identificada como Fable na tabela de comparação de planos no dia em que tomar a decisão e considere desatualizado qualquer valor apresentado num artigo de notícias.

O que permanece estável é a tarifa da API. Em qualquer rota, depois de esgotar o limite incluído, a utilização adicional do Fable 5 é faturada pelos preços apresentados no gráfico acima. Assim, a lista de preços é o valor a utilizar no planeamento em qualquer dos casos. Essa é também a conclusão a que se chega ao comparar a faturação da API com uma subscrição para qualquer outro modelo Claude. Se ainda não escolheu um nível, comece por identificar o plano Claude adequado à sua utilização.

Por que a sua fatura fica acima do que a proporção de preços sugere

Dois mecanismos documentados fazem o Fable 5 custar mais do que uma comparação direta de preços indica.

O primeiro é o tokenizador. O Fable 5 usa o tokenizador introduzido com o Claude Opus 4.7. Em comparação com modelos lançados antes do Opus 4.7, o mesmo texto produz aproximadamente 30% mais tokens, e o aumento exato depende do conteúdo. O Haiku 4.5 é anterior a esse tokenizador, portanto a diferença de dez vezes na lista de preços fica mais próxima de treze vezes quando os dois modelos recebem o mesmo bloco de texto. O Sonnet 5 usa o tokenizador mais recente, portanto a comparação entre Fable e Sonnet é justa por token. A comparação entre Fable e Haiku não é.

O segundo é o raciocínio. O adaptive thinking está sempre ativado no Fable 5, e thinking: {"type": "disabled"} não é suportado. Os tokens de raciocínio são cobrados como tokens de saída, à tarifa integral de saída. A cadeia de raciocínio bruta nunca é devolvida por este modelo, e thinking.display assume "omitted" por padrão. Isso significa que uma resposta visível curta pode incluir uma quantidade elevada de tokens de saída faturados. A documentação da Anthropic afirma isso claramente: a quantidade de tokens de saída faturados não corresponde à quantidade de tokens visíveis na resposta.

Consulte a discriminação em vez de fazer uma estimativa. O campo usage.output_tokens_details.thinking_tokens informa quantos tokens de saída faturados foram usados no raciocínio:

{
  "usage": {
    "input_tokens": 25,
    "output_tokens": 348,
    "output_tokens_details": {
      "thinking_tokens": 312
    }
  }
}

Nesse exemplo, retirado da documentação da Anthropic sobre thinking, 312 dos 348 tokens de saída faturados foram usados em raciocínio que ninguém viu. Ao fazer streaming, essa discriminação chega apenas no evento message_delta final. Portanto, um cliente que pare de ler no último bloco de texto nunca a registará.

O controlo é effort, definido em output_config.effort, com os níveis low, medium, high (o padrão), xhigh e max.

{
  "model": "claude-fable-5",
  "max_tokens": 32000,
  "output_config": { "effort": "medium" },
  "messages": [{ "role": "user", "content": "..." }]
}

A orientação da Anthropic para este modelo é começar em high, passar para xhigh apenas nos trabalhos mais sensíveis à capacidade e descer para medium ou low em trabalhos de rotina. A justificação é que um esforço menor no Fable 5 muitas vezes supera xhigh em modelos anteriores. Há duas armadilhas. Alterar o esforço entre pedidos invalida a cache do prompt, porque o valor de esforço resolvido é inserido no prompt. Escolha um nível por carga de trabalho e mantenha-o constante. Além disso, max_tokens é um limite rígido para a saída total, que inclui o raciocínio e o texto da resposta. Um limite definido para uma resposta sem raciocínio causará truncamento. Ver stop_reason: "max_tokens" significa que deve aumentar o limite ou reduzir o esforço.

Custo por tarefa concluída, não custo por token

ChartCost of one job in US dollars, worked from published rates and assumed token volumes
The data behind this chart
[
  {
    "label": "Short answer (5k in, 1k out)",
    "fable_5": "0.10",
    "opus_5": "0.05",
    "sonnet_5": "0.02",
    "haiku_4_5": "0.01"
  },
  {
    "label": "Coding session (300k in, 40k out)",
    "fable_5": "5.00",
    "opus_5": "2.50",
    "sonnet_5": "1.00",
    "haiku_4_5": "0.50"
  },
  {
    "label": "Long agent run (2M in, 400k out)",
    "fable_5": "40.00",
    "opus_5": "20.00",
    "sonnet_5": "8.00",
    "haiku_4_5": "4.00"
  }
]

Essas 3 linhas são cálculos aritméticos, não um benchmark. As tarifas são públicas. Os volumes de tokens são pressupostos que deve substituir por valores dos seus próprios dados de utilização. Uma sessão de programação com a dimensão da linha intermédia custa $5.00 no Fable 5, contra $1.00 no Sonnet 5. A execução longa custa $40.00, contra $8.00. O valor da coluna Haiku nessa última linha é apenas aritmético: o Haiku 4.5 tem uma janela de contexto de 200k tokens, por isso não consegue conter essa tarefa.

O custo por token é a unidade errada para uma decisão. O custo por tarefa concluída é o custo por tentativa multiplicado pelo número de tentativas. Com as tarifas atuais, uma tentativa no Fable 5 custa o mesmo que cinco tentativas no Sonnet 5, por isso o número de repetições, por si só, quase nunca justifica a atualização. O Sonnet teria de falhar mais de quatro vezes em cinco para a opção mais barata deixar de compensar em tokens.

O que justifica a opção mais cara é tudo o que a fatura de tokens não inclui. A diferença entre as duas execuções longas no gráfico é inferior ao custo de uma hora de trabalho de engenharia na maioria dos mercados. Se o modelo mais caro poupar uma hora de revisão ou evitar uma migração incorreta que depois teria de desfazer, já se pagou a si próprio numa fatura que nunca mostra essa poupança. Faça a comparação em dinheiro por resultado aceite e inclua o seu próprio tempo no total. Saber o que um milhão de tokens compra realmente torna essa estimativa muito menos abstrata.

Três tarefas em que o Claude Fable 5 justifica o preço

Execuções de agentes com horizonte longo, em que uma decisão errada tem um custo elevado. O Fable 5 foi concebido para trabalho medido em horas: uma janela de contexto de 1M tokens, até 128k tokens de saída por pedido e um nível de esforço xhigh destinado a tarefas com mais de trinta minutos de execução e orçamentos de milhões de tokens. Compare o custo da execução com o trabalho de correção necessário depois de um agente seguir um caminho errado no passo 40, que só é detetado no passo 300.

Uma migração ou auditoria executada uma vez num codebase de grandes dimensões. O trabalho pontual não tem volume suficiente para diluir o custo. O preço adicional por token recai numa única fatura, e toda a tarefa pode caber numa única janela de contexto. Se puder ser executada de forma assíncrona, a Batch API reduz o custo para metade: $25 por milhão de tokens de saída.

A tarefa em que um modelo mais barato já falhou duas vezes. Duas tentativas falhadas, somadas ao tempo de depuração, custam mais do que uma tentativa com o Fable nos volumes apresentados no gráfico acima. Escalar para um modelo superior é a opção mais barata, e é para isso que serve uma hierarquia de modelos. Se ainda está a escolher entre níveis de forma geral, a comparação de capacidades entre os níveis de modelos Claude responde a uma pergunta diferente da desta página.

Três tarefas em que Sonnet 5 ou Haiku 4.5 é a resposta correta

Classificação e extração em grande volume. Estas tarefas são avaliadas pelo débito e pelo custo unitário, e o limite de qualidade é suficientemente baixo para que um modelo barato o atinja. A um preço dez vezes superior ao de uma tarefa que Haiku 4.5 conclui corretamente, Fable 5 não oferece qualquer benefício mensurável.

Trabalho interativo em que a latência é o produto. A tabela de modelos da Anthropic indica que a latência comparativa de Fable 5 é mais elevada, e o raciocínio não pode ser desativado. Uma caixa de chat ou uma conclusão no editor funciona pior com o modelo mais capaz, porque os utilizadores percebem a espera antes de perceberem a qualidade.

Qualquer tarefa que dependa de eventos posteriores a janeiro de 2026. O limite de conhecimento fiável de Fable 5 é janeiro de 2026. O de Opus 5 é maio de 2026. O modelo mais caro é o menos atual, portanto, em questões sobre atualidade, paga o dobro por conhecimento mais antigo, a menos que lhe forneça ferramentas de pesquisa ou obtenção de dados.

Existe uma restrição que não está relacionada com o custo. Fable 5 mantém os dados durante 30 dias e não está disponível com retenção zero, porque está designado como Covered Model. Se o seu contrato exigir retenção zero, Fable 5 não é uma opção a qualquer preço, e nenhum desconto altera essa condição.

O que os repositórios fable-method mostram e o que não mostram

Profissionais publicaram repositórios que condensam a forma como as abordagens do Fable 5 funcionam em competências que um modelo mais barato consegue seguir. O repositório fable-method descreve uma competência de raciocínio, um ciclo de orquestração e um verificador adversarial que executa novamente cada verificação declarada, em vez de ler o próprio relatório do agente. O README afirma isso diretamente: "Esta é uma condensação da comunidade, não um artefacto da Anthropic."

Trate-o exatamente como tal. É uma evidência de como as pessoas estão a orientar o modelo, mas não é documentação de como o modelo funciona. Nada nele foi validado pela Anthropic, e existem vários forks quase idênticos com redações diferentes. Isso é o que seria de esperar de conhecimento transmitido informalmente, não de uma especificação.

O sinal relevante para uma decisão de custo é que as partes que as pessoas consideraram úteis para copiar são processuais. Classifique a tarefa, indique a verificação que prova que ela está concluída, recolha evidências antes de decidir e, em seguida, verifique por observação, em vez de ler um resumo. Um modelo mais barato ao qual seja fornecida uma checklist explícita e uma etapa de verificação consegue reduzir parte da diferença. Por isso, execute essa experiência no seu próprio conjunto de avaliação antes de padronizar o uso do modelo mais caro. O resultado depende das suas tarefas. É por isso que o número de outra pessoa tem pouco valor para si.

Verifique os seus próprios números antes de comprometer o orçamento

  • Leia usage em todas as respostas e registe output_tokens_details.thinking_tokens separadamente do resultado visível. O raciocínio que nunca vê é o item de custo que mais surpreende.
  • Defina effort explicitamente em vez de aceitar o valor predefinido e mantenha-o constante em qualquer conversa que dependa de prompt caching.
  • Coloque primeiro o prefixo estável atrás de um ponto de cache. Uma leitura da cache a um décimo do preço da entrada base permite poupar mais do que a maioria das reduções de modelo.
  • Transfira para a Batch API tudo o que não precisa de uma resposta imediata.
  • Calcule o preço da alternativa de forma realista. Comparar os preços da API do Claude e do ChatGPT na sua própria carga de trabalho vale uma tarde antes de assumir um compromisso prolongado.

Se a carga de trabalho for um agente executado no seu próprio servidor, os controlos mais importantes estão fora da escolha do modelo. Manter os custos de um agente sob controlo num VPS aborda os limites do ciclo e os limites de despesa que interrompem uma sessão descontrolada, e onde o Claude Code gasta realmente tokens explica os números apresentados no seu painel de utilização.

FAQ

Quanto custa o Claude Fable 5 por milhão de tokens?

O Claude Fable 5 custa $10 por milhão de tokens de entrada e $50 por milhão de tokens de saída na API do Claude, de acordo com a página de preços da Anthropic consultada em 3 de agosto de 2026. A leitura da cache custa $1 por milhão de tokens, um décimo do preço base dos tokens de entrada. A Batch API aplica um desconto de 50% a ambas as categorias, resultando em $5 e $25 por milhão de tokens para processamento assíncrono. Manter a inferência nos Estados Unidos com o parâmetro inference_geo acrescenta um multiplicador de 1.1 a todas as categorias.

O Claude Fable 5 está incluído numa subscrição Claude Pro?

A página do Claude Fable da Anthropic indica que o modelo está disponível para utilizadores Pro, Max, Team e Enterprise, e não menciona o plano gratuito. O acesso incluído não é ilimitado. Algumas contas têm acesso ao Fable como parte dos limites semanais de utilização, enquanto outras utilizam créditos de uso. Essa organização mudou mais de uma vez durante julho de 2026. Consulte a linha identificada como Fable na tabela de comparação de planos da página de preços da Anthropic no dia em que tomar a decisão, em vez de confiar num valor apresentado num artigo. Depois de esgotar a utilização incluída, a utilização adicional é cobrada à tarifa da API.

Porque é que a minha fatura do Claude Fable 5 é superior ao que o resultado visível sugere?

O pensamento adaptativo está sempre ativado no Claude Fable 5, os tokens de pensamento são cobrados como tokens de saída e a cadeia de pensamento completa nunca é devolvida. Com thinking.display no valor predefinido de omitted, é apresentado um campo de pensamento vazio, embora todos os tokens de raciocínio subjacentes sejam cobrados. Consulte usage.output_tokens_details.thinking_tokens na resposta para ver a divisão e tenha em conta que, em streaming, esse campo só chega no evento message_delta final. Reduza o nível effort se a proporção entre raciocínio e resposta for superior ao necessário para a tarefa.

Devo usar o Claude Fable 5 ou o Claude Opus 5?

O Claude Opus 5 custa metade por token e tem uma data de corte de conhecimento fiável mais recente: maio de 2026, contra janeiro de 2026 no Fable 5. Comece pelo Opus 5 e mude para o Fable quando uma tarefa falhar no Opus ou quando o custo de uma resposta errada for superior à diferença de preço. O Fable 5 é a escolha adequada para trabalho de agentes com horizonte longo, em que um ramo incorreto pode exigir horas de correções, e para tarefas pontuais cujo custo adicional surge numa única fatura, em vez de ser aplicado a todos os pedidos indefinidamente.

#claude#fable#model-selection#pricing#tokens