Qual modelo Claude usar? Guia de custos
Comparativo de preços Claude API em julho de 2026. Veja os valores por MTok para Opus 4.8, Sonnet 5 e Haiku 4.5 e o impacto no custo de 100k jobs.
Qual modelo Claude devo usar?
A resposta curta sobre qual modelo Claude usar: comece com o Claude Opus 4.8, e mude apenas se houver um motivo específico. A orientação da Anthropic é a mesma. "Se você não tiver certeza de qual modelo usar, comece com o Claude Opus 4.8 para codificação agentica complexa e trabalho empresarial." Mude para o Claude Sonnet 5 quando a tarefa estiver bem especificada e você a executar muitas vezes por dia. Mude novamente para o Claude Haiku 4.5 para trabalhos mecânicos de alto volume onde você já sabe qual é a resposta correta. O Claude Fable 5 fica acima de todos eles, para agentes de longa duração.
A escolha tem um custo. Estas são as tarifas da Claude API (application programming interface) em 23 de julho de 2026, por milhão de tokens, que a documentação escreve como MTok.
- Claude Fable 5 (
claude-fable-5): $10 / MTok in, $50 / MTok out. 1M context. - Claude Opus 4.8 (
claude-opus-4-8): $5 in, $25 out. 1M context. - Claude Opus 4.7 (
claude-opus-4-7): $5 in, $25 out. 1M context. - Claude Sonnet 5 (
claude-sonnet-5): $2 in, $10 out em preço introdutório até 31 de agosto de 2026. O padrão de $3 in, $15 out entra em vigor em 1 de setembro de 2026. 1M context. - Claude Haiku 4.5 (
claude-haiku-4-5): $1 in, $5 out. 200K context.
Esses identificadores estão completos conforme escritos. Nada é anexado a eles.
O tamanho em si não possui sobretaxa nos modelos de 1M-token: "Uma requisição de 900k-token é cobrada na mesma taxa por token que uma requisição de 9k-token."
Para que serve cada modelo
A Anthropic descreve a linha de produtos com uma frase por modelo, e essas descrições são mais úteis que qualquer leaderboard.
- Claude Fable 5: "Inteligência de próxima geração para agentes de longa duração." Classificado como o mais lento dos quatro em latência.
- Claude Opus 4.8: "Para codificação agentica complexa e trabalho empresarial." Latência moderada.
- Claude Sonnet 5: "A melhor combinação de velocidade e inteligência." Rápido.
- Claude Haiku 4.5: "O modelo mais rápido com inteligência próxima ao frontier."
O Haiku 4.5 também possui limitações que definem a adequação ao trabalho antes mesmo do preço. Sua janela de contexto é de 200K tokens em vez de 1M, portanto, um repositório grande ou um log longo de agente não caberá. Seu output máximo na Messages API síncrona é de 64K tokens, contra 128K dos outros, e seu cutoff de conhecimento confiável é fevereiro de 2025, enquanto os outros três estão em janeiro de 2026.
Quanto a escolha me custa em uma carga de trabalho real?
Todos os modelos da linha cobram o output a cinco vezes a taxa do input. O Opus 4.8 custa $5 no input e $25 no output. O Haiku 4.5 custa $1 no input e $5 no output. Essa proporção se mantém em toda a linha, portanto a escolha do modelo é crucial para tarefas que geram muito output.
Trabalhos agentic são desse tipo, pois tokens de raciocínio são faturados como tokens de output e contam para max_tokens mesmo quando o texto não chega até você. No Fable 5, Opus 4.8, Opus 4.7 e Sonnet 5, o resumo de raciocínio é omitido por padrão, então o campo thinking retorna vazio. O faturamento não muda: "De qualquer forma, o bloco é faturado da mesma maneira e retornado da mesma maneira em conversas de múltiplos turnos." O que realmente preenche uma fatura do Claude analisa esse processo detalhadamente.
Se o raciocínio (thinking) é executado ou não varia entre os modelos comparados, o que invalidará um teste de custo se você ignorar isso. No Sonnet 5 e Fable 5, o thinking já vem ativado e não requer configuração. No Opus 4.8 e Opus 4.7, ele vem desativado até que você defina thinking: {type: "adaptive"} na requisição. Padronize a configuração em ambos os lados antes de analisar os números.
Por que o modelo mais barato pode ser o mais caro
Considere uma tarefa de codificação isolada. A requisição possui 60.000 tokens de contexto e o modelo gera 8.000 tokens de saída, incluindo o processamento de pensamento (thinking). Sem uso de cache, o cálculo permanece direto.
No Opus 4.8: 0.06 MTok de input a $5 resulta em $0.30, e 0.008 MTok de output a $25 resulta em $0.20. A tentativa custa $0.50. No Haiku 4.5, a mesma tentativa custa $0.06 mais $0.04, totalizando $0.10.
O Haiku é cinco vezes mais barato por tentativa, o que parece uma grande economia até você analisar o impacto de uma tentativa falha. Você lê a resposta errada, o que consome seu tempo. Você reenvia essa resposta como contexto na tentativa de correção, tornando cada tentativa maior que a anterior. Quando a terceira tentativa falha, você faz o upgrade para o modelo superior: $0.30 do Haiku mais $0.50 do Opus totalizam $0.80, ou 60% a mais do que rodar o Opus uma única vez.
Portanto, a pergunta decisiva é quão barato você consegue validar a resposta. Quando uma resposta errada é óbvia em um segundo, o modelo pequeno é vantajoso. Quando identificar o erro exige ler um diff cuidadosamente, o modelo pequeno custa tempo, um valor que não aparece na fatura.
Quando um modelo menor é a escolha ideal
O Haiku 4.5 é a resposta correta nestes casos:
- Tarefas mecânicas de subagentes. Um subagente que renomeia arquivos ou coleta resultados de busca não precisa de raciocínio avançado. Este é o padrão comum após você build an AI agent with Claude e fornecer assistentes.
- Triagem de logs. Decidir se uma linha é ruído ou se merece atenção humana é um julgamento restrito com um modo de falha óbvio.
- Classificação contra um conjunto fixo de rótulos. O output é curto e a precisão é mensurável em uma amostra.
- Chamadas de produção de alto volume. Com 100.000 execuções por dia, a diferença de custo por token deixa de ser um erro de arredondamento. Este é o formato comum de AI workflows wired into n8n.
- Qualquer situação onde a velocidade de resposta seja importante para o usuário. O Haiku 4.5 é classificado como o modelo mais rápido da linha.
Um limite pertence especificamente ao Haiku. Seu prompt mínimo para cache é de 4.096 tokens, contra 1.024 no Opus 4.8 e Sonnet 5; abaixo desse mínimo, "any requests to cache fewer than this number of tokens will be processed without caching, and no error is returned". Um bloco de instrução de 1.500 tokens que utiliza cache no Sonnet 5 não utilizará cache no Haiku 4.5 de forma silenciosa. O sinal é o cache_creation_input_tokens e o cache_read_input_tokens ambos em zero, o que keeping an always-on agent's costs down aborda junto com outras formas de perder o cache.
Os parâmetros que alteram a resposta
Cada um destes fatores impacta o custo mais do que o nome do modelo.
Effort. O output_config.effort controla quanto trabalho o modelo realiza antes de responder. Os níveis são low, medium, high, xhigh e max, sendo o high o padrão: "Configurar effort para high produz exatamente o mesmo comportamento de omitir o parâmetro effort completamente." Ele é um subcampo de output_config em vez de estar no nível principal da requisição:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)O Effort afeta cada token na resposta: "Ele pode afetar todo o gasto de tokens, incluindo tool calls. Por exemplo, um effort menor faria o Claude realizar menos tool calls." Isso gera um efeito cumulativo em loops de agentes. Não é um limite de tokens: "Effort é um sinal comportamental, não um orçamento estrito de tokens." A Anthropic não publica um multiplicador de custo por nível e recomenda que você teste seu próprio caso de uso; portanto, uma execução do Sonnet 5 em high contra uma execução do Opus 4.8 em low é uma comparação real que você pode realizar hoje mesmo. O Haiku 4.5 não está na lista de modelos que suportam effort.
Prompt caching. Uma leitura de cache custa 0.1x a taxa base de input, e o valor que define a escolha de um modelo é o que ele representa entre as tiers. Um cache hit no Opus 4.8 custa $0.50 / MTok, enquanto o input sem cache no Haiku 4.5 custa $1 / MTok; logo, um prefixo Opus bem cacheado é mais barato por token de input do que um prompt Haiku sem cache. A higiene de sessão é mais importante que a escolha do modelo em qualquer workload que reenvie um prefixo grande e estável.
Batches. Se a resposta não precisar ser imediata, a Message Batches API executa os mesmos modelos com "50% de desconto tanto em tokens de input quanto de output". Isso reduz pela metade cada linha da comparação abaixo, e funciona em todas as tiers: um job em batch no Opus 4.8 custa menos que um job síncrono no Sonnet 5 ao preço padrão a partir de 1 de setembro de 2026, trocando latência por capacidade pelo mesmo valor.
Comparação de custo por carga de trabalho
A carga de trabalho: classificar 100.000 e-mails de suporte, uma chamada para cada, 2.000 input tokens e 300 output tokens por chamada. Isso resulta em 200 MTok de input e 30 MTok de output.
- Haiku 4.5: 200 x $1 = $200 in, 30 x $5 = $150 out. Total $350.
- Sonnet 5, tarifa introdutória: 200 x $2 = $400 in, 30 x $10 = $300 out. Total $700.
- Sonnet 5, a partir de 1 de setembro de 2026: 200 x $3 = $600 in, 30 x $15 = $450 out. Total $1.050.
- Opus 4.8: 200 x $5 = $1.000 in, 30 x $25 = $750 out. Total $1.750.
Altere quatro números para refazer o cálculo com os preços de amanhã. Os ajustes abaixo alteram o resultado mais do que o nome do modelo:
- Batching reduz o custo pela metade em cada linha: $175, $350, $525 e $875. Nenhuma tarefa aguarda em uma execução de classificação noturna, portanto não há razão para não utilizá-lo.
- Caching do prefixo compartilhado. Suponha que 1.200 dos 2.000 input tokens sejam o mesmo bloco de instrução em todas as chamadas. No Sonnet 5 com a tarifa introdutória, esses tokens custam $0,20 / MTok como cache hits em vez de $2 / MTok; logo, 120 MTok custam $24 em vez de $240. Adicione 80 MTok de input novo a $2, que são $160, mais $300 de output, e o Sonnet 5 chega perto de $484 em vez de $700. O mesmo recurso não tem efeito no Haiku 4.5, pois 1.200 tokens está abaixo do mínimo de 4.096 tokens.
- Retries. Suponha que você rejeite a resposta do Haiku em 8% dos e-mails e reexecute esses casos no Opus 4.8. Adicione 0,08 x $1.750 = $140 aos $350, resultando em $490. Meça sua própria taxa de rejeição em vez de usar a minha.
- Tool definitions, se o job as utilizar. O system prompt gerado possui 290 tokens no Opus 4.8 com
tool_choicedefinido comoauto, 354 no Sonnet 5 e 496 no Haiku 4.5. O modelo mais barato possui o maior overhead fixo.
Haiku com um caminho de escalonamento a $490 e Sonnet 5 com cache a $484 custam o mesmo, e um deles realiza o trabalho em uma única passagem. O modelo nunca foi a questão completa.
Trocar de modelo durante a sessão economiza dinheiro?
Menos do que os preços de tabela sugerem, pois a economia é por token e o risco é perder um prefixo inteiro em cache.
A Anthropic documenta o que invalida um cache. Os prefixos são construídos na ordem tools, depois system, depois messages, e "Mudanças em cada nível invalidam esse nível e todos os níveis subsequentes". Duas configurações de requisição também estão nessa lista: "A configuração de thinking e o nível effort resolvido são renderizados no próprio prompt, portanto, alterar qualquer um deles inicia um novo prefixo de cache". Na documentação, eles são ainda mais específicos: "varie o effort entre cargas de trabalho em vez de dentro de uma conversa que dependa de cache hits".
O modelo não está nessa lista documentada, então não presuma nada. Verifique o cache_read_input_tokens na primeira requisição após a troca e use o valor como resposta. Em um prefixo Opus de 150.000 tokens, uma leitura de cache custa cerca de $0.08 e uma escrita nova custa cerca de $0.94, o que é mais caro do que a diferença de preço por token de várias interações.
Portanto, altere essas configurações entre tarefas, não dentro de uma mesma tarefa. No Claude Code, isso significa /clear primeiro, quando o cache já será descartado, e depois /model ou /effort.
Como testar a resposta na sua própria carga de trabalho
Não dimensione um prompt usando a contagem de um modelo diferente. O endpoint de contagem de tokens é gratuito e utiliza o tokenizer do modelo que você especificar; portanto, especifique o modelo que você pretende chamar. O Opus 4.7 e versões posteriores, o Fable 5 e o Sonnet 5 utilizam um tokenizer mais recente que "produz aproximadamente 30% mais tokens para o mesmo texto", portanto, um orçamento medido em um modelo antigo resultará em um valor baixo em um modelo novo, mesmo com a taxa por token inalterada.
Em seguida, analise o retorno. input_tokens é apenas o restante sem cache, portanto, o tamanho real do prompt é esse campo somado a cache_creation_input_tokens e cache_read_input_tokens. Um primeiro app Claude API em um VPS é o lugar mais simples e confiável para realizar essa medição, e qual plano Claude se adequa ao seu uso é uma decisão separada sobre se você pagará por token ou não.
FAQ
Qual modelo Claude é melhor para coding?
O Claude Opus 4.8 é o ponto de partida documentado para coding agentic complexo, custando $5 por milhão de tokens de input e $25 por milhão de output em julho de 2026. O Claude Sonnet 5 é posicionado como a melhor combinação de velocidade e inteligência; com o preço de $2 / $10 até 31 de agosto de 2026, ele custa menos da metade. Execute a mesma tarefa em ambos, mantenha a configuração de thinking constante e compare o gasto total de tokens a partir de response.usage.
O Claude Haiku 4.5 é barato o suficiente para substituir o Sonnet 5?
Por token, sim: $1 / $5 contra $2 / $10 para o Sonnet 5 em preço introdutório, ou $3 / $15 a partir de 1 de setembro de 2026. Os limites são o fator decisivo. O Haiku 4.5 possui uma janela de contexto de 200K tokens em vez de 1M, um output máximo de 64K na Messages API síncrona, um cutoff de conhecimento confiável de fevereiro de 2025, sem suporte a output_config.effort e um prompt minimamente cacheável de 4.096 tokens que desativa o cache em system prompts curtos.
Mudar para um modelo Claude mais barato no meio da sessão economiza dinheiro?
Menos vezes do que parece. A Anthropic documenta os invalidadores de cache como alterações no prefixo tools, system ou messages, alterações na configuração de thinking e alterações em output_config.effort. O impacto de uma troca de modelo em um cache existente não é documentado; trate como desconhecido e leia cache_read_input_tokens no primeiro request subsequente. O risco vale a pena: em um prefixo de 150.000 tokens no Opus 4.8, um cache read custa cerca de $0.08 e um write novo cerca de $0.94, o que supera várias iterações da economia por token. Alterne entre tarefas após /clear no Claude Code, quando o cache será descartado de qualquer forma.
O que o output_config.effort faz com minha fatura?
Ele altera a quantidade de tokens que o modelo consome em texto, tool calls e thinking. Um effort menor gera menos tool calls, o que acumula em loops agentic porque cada resultado de ferramenta é reenviado em turnos posteriores. Os níveis são low, medium, high, xhigh e max, sendo high o padrão. A Anthropic não publica um multiplicador de custo por nível, tratando o effort como um sinal comportamental em vez de um orçamento de tokens; portanto, meça o custo em sua própria tarefa.
Quanto o Claude Batches API economiza?
50% em tokens de input e output, em troca de entrega assíncrona. Em julho de 2026, isso coloca o Opus 4.8 em $2.50 in / $12.50 out, o Sonnet 5 em $1 / $5 em preço introdutório, e o Haiku 4.5 em $0.50 / $2.50. A comparação relevante ocorre entre tiers: um job de Opus 4.8 em batch custa menos que um job síncrono do Sonnet 5 na taxa padrão a partir de 1 de setembro de 2026; portanto, o batching permite usar um modelo mais forte pelo mesmo valor.