Qual modelo Claude usar? Guia de custos da API
Opus 4.8, Sonnet 5 ou Haiku 4.5? Veja as tarifas de julho de 2026, o custo de 100.000 tarefas e quais configurações mais alteram a conta.
Que modelo Claude devo utilizar?
A resposta curta à pergunta sobre qual modelo Claude deve utilizar é: comece pelo Claude Opus 4.8 e só deixe de o utilizar por um motivo concreto. A orientação da Anthropic é a mesma. “Se não tiver a certeza de qual modelo utilizar, comece pelo Claude Opus 4.8 para programação agentic complexa e trabalho empresarial.” Passe para o Claude Sonnet 5 quando a tarefa estiver bem especificada e for executada muitas vezes por dia. Passe novamente para o Claude Haiku 4.5 para trabalho mecânico e de grande volume, quando já souber qual é o aspeto de uma resposta correta. O Claude Fable 5 está acima de todos eles, para agentes de execução prolongada.
A escolha tem um custo associado. Estas são as tarifas da Claude API (interface de programação de aplicações) em 23 July 2026, por milhão de tokens, que a documentação designa por MTok.
- Claude Fable 5 (
claude-fable-5): $10 / MTok de entrada, $50 / MTok de saída. Contexto de 1M. - Claude Opus 4.8 (
claude-opus-4-8): $5 de entrada, $25 de saída. Contexto de 1M. - Claude Opus 4.7 (
claude-opus-4-7): $5 de entrada, $25 de saída. Contexto de 1M. - Claude Sonnet 5 (
claude-sonnet-5): $2 de entrada, $10 de saída com o preço introdutório até 31 August 2026. O preço normal de $3 de entrada, $15 de saída entra em vigor em 1 September 2026. Contexto de 1M. - Claude Haiku 4.5 (
claude-haiku-4-5): $1 de entrada, $5 de saída. Contexto de 200K.
Estes identificadores estão completos tal como são apresentados. Não é acrescentado nada ao final.
O tamanho não acrescenta qualquer custo nos modelos de 1M de tokens: "um pedido de 900k tokens é faturado à mesma tarifa por token que um pedido de 9k tokens". Essas tarifas também se aplicam para além da API, porque o Claude Enterprise calcula a utilização com tarifas de API além do preço por lugar. Portanto, tudo o que se segue usa a mesma aritmética para uma equipa num plano por lugares. Uma subscrição de preço fixo altera o medidor, mas não esta decisão, porque os dois níveis do Claude Max incluem os mesmos modelos e diferem apenas na quantidade de utilização disponível. Num nível inferior da mesma oferta, os $20 mensais do Claude Pro compram um limite de utilização, e não uma tarifa por token, por isso o que o impede de continuar é a reposição do limite, e não uma fatura. Se é nessa situação que se encontra agora, determinar qual é a janela que está a aguardar vem antes de qualquer cálculo abaixo, porque a solução é usar um modelo menor, um contexto menor ou mudar para a API, e não procurar uma tarifa mais baixa. E, se ainda não começou a pagar, saber se o Pro vale os $20 à partida depende da frequência com que o limite gratuito o impede de continuar, e não de qualquer uma das tarifas acima.
Para que serve realmente cada modelo
A Anthropic descreve a linha com uma frase por modelo, e essas frases orientam melhor do que qualquer tabela de classificação.
- Claude Fable 5: "Inteligência de próxima geração para agentes de execução prolongada." É avaliado como o mais lento dos quatro em latência.
- Claude Opus 4.8: "Para programação agêntica complexa e trabalho empresarial." Latência moderada.
- Claude Sonnet 5: "A melhor combinação de velocidade e inteligência." Rápido.
- Claude Haiku 4.5: "O modelo mais rápido, com inteligência próxima da fronteira."
O Fable 5 é o único dos quatro cujo preço esta comparação nunca calcula com base numa carga de trabalho. Como custa o dobro do Opus 4.8, a questão de quais trabalhos justificam gastar $10 para obter $50 merece uma resposta própria.
O Haiku 4.5 também tem limites que determinam a adequação ao trabalho antes mesmo do preço. A janela de contexto é de 200K tokens, em vez de 1M, por isso um repositório grande ou uma transcrição longa de um agente não caberá. O limite máximo de saída na API Messages síncrona é de 64K tokens, contra 128K nos outros modelos. Além disso, o limite de conhecimento fiável é fevereiro de 2025, enquanto nos outros três é janeiro de 2026.
Quanto me custa essa escolha numa carga de trabalho real?
Todos os modelos da linha cobram a saída a cinco vezes a taxa da entrada. O Opus 4.8 custa $5 pela entrada e $25 pela saída. O Haiku 4.5 custa $1 pela entrada e $5 pela saída. A proporção mantém-se em toda a gama, por isso o modelo escolhido tem maior impacto no trabalho que gera muita saída.
O trabalho agêntico é desse tipo, porque os tokens de raciocínio são cobrados como tokens de saída e contam para max_tokens mesmo quando o texto nunca chega até si. No Fable 5, Opus 4.8, Opus 4.7 e Sonnet 5, o resumo do raciocínio é omitido por predefinição, por isso o campo thinking vem vazio. A faturação não muda: "Em qualquer dos casos, o bloco é faturado da mesma forma e devolvido da mesma forma em conversas de várias interações." O que preenche efetivamente uma fatura de tokens do Claude explica esse contador em detalhe.
O facto de o raciocínio ser executado varia entre os modelos que está a comparar. Se não tiver isso em conta, o teste de custos ficará comprometido. No Sonnet 5 e no Fable 5, o raciocínio já está ativado e não requer configuração. No Opus 4.8 e no Opus 4.7, está desativado até definir thinking: {type: "adaptive"} no pedido. Use a mesma configuração nos dois lados antes de tirar conclusões dos números.
Por que o modelo mais barato pode ser o mais caro
Considere uma tarefa de programação autónoma. O pedido contém 60,000 tokens de contexto, e o modelo produz 8,000 tokens de saída, incluindo o raciocínio. Não há caching, por isso a conta permanece visível.
No Opus 4.8: 0.06 MTok de entrada a $5 custam $0.30, e 0.008 MTok de saída a $25 custam $0.20. A tentativa custa $0.50. No Haiku 4.5, a mesma tentativa custa $0.06 mais $0.04, ou seja, $0.10.
O Haiku é cinco vezes mais barato por tentativa. Isto parece deixar uma margem ampla, até analisar o que acontece quando uma tentativa falha. Você lê a resposta errada, o que consome o seu tempo. Você reenvia essa resposta como contexto na nova tentativa, por isso cada tentativa fica maior do que a anterior. E, quando a terceira tentativa ainda falha, você recorre ao modelo superior: $0.30 de Haiku mais $0.50 de Opus dão $0.80, ou seja, mais 60% do que executar o Opus uma vez.
Por isso, a questão decisiva é saber a que custo você consegue verificar a resposta. Quando uma resposta errada é evidente num segundo, o modelo pequeno é uma boa escolha. Quando detetar o erro exige ler cuidadosamente um diff, o modelo pequeno consome tempo que nunca aparece na fatura. Atribuir um valor a esse tempo usa a mesma conta que calcular se um plano do Claude Code se paga, e, quando a sua própria tarifa horária entra na equação, o modelo mais barato muitas vezes deixa de parecer barato.
Onde um modelo menor ganha claramente
Haiku 4.5 é a escolha certa nestes casos:
- Trabalho mecânico de subagentes. Um subagente que renomeia ficheiros ou recolhe resultados de pesquisa não precisa de raciocínio de fronteira. Esse é o padrão habitual depois de criar um agente de IA com Claude e lhe fornecer auxiliares.
- Triagem de logs. Decidir se uma linha é ruído ou merece a atenção de uma pessoa é uma avaliação limitada, com um modo de falha evidente.
- Classificação com base num conjunto fixo de etiquetas. A saída é curta e a precisão pode ser medida numa amostra.
- Chamadas de produção em grande volume. Com 100,000 execuções por dia, a diferença por token deixa de ser um erro de arredondamento. Essa é a estrutura habitual de workflows de IA ligados ao n8n.
- Qualquer situação em que a velocidade de resposta seja importante para o utilizador. Haiku 4.5 é considerado o modelo mais rápido da linha.
Existe uma limitação específica do Haiku. O seu prompt mínimo armazenável em cache tem 4,096 tokens, contra 1,024 no Opus 4.8 e no Sonnet 5. Abaixo desse mínimo, "qualquer pedido para armazenar em cache menos do que este número de tokens será processado sem cache e não será devolvido nenhum erro". Um bloco de instruções com 1,500 tokens que é armazenado em cache no Sonnet 5 não é armazenado em cache no Haiku 4.5, sem indicação explícita. O sinal é cache_creation_input_tokens e cache_read_input_tokens estarem ambos a zero. Manter baixos os custos de um agente sempre ativo aborda este caso, juntamente com as outras formas de perder uma cache.
Os fatores que alteram a resposta
Cada um destes fatores altera mais o custo do que o nome do modelo.
Esforço. output_config.effort controla quanto trabalho o modelo executa antes de responder. Os níveis são low, medium, high, xhigh e max, e high é o valor predefinido: "Definir effort como high produz exatamente o mesmo comportamento que omitir totalmente o parâmetro effort." Este parâmetro fica dentro de output_config, em vez de ficar no nível superior do pedido:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)O esforço afeta todos os tokens da resposta: "Pode afetar todo o consumo de tokens, incluindo chamadas de ferramentas. Por exemplo, um esforço menor faria com que Claude fizesse menos chamadas de ferramentas." Isto acumula-se num ciclo agêntico. Não é um limite de tokens: "O esforço é um sinal comportamental, não um orçamento de tokens estrito." A Anthropic não publica um multiplicador de custo por nível e recomenda testar o seu próprio caso de uso. Assim, uma execução do Sonnet 5 com high comparada com uma execução do Opus 4.8 com low é uma comparação real que pode executar ainda hoje. Haiku 4.5 não aparece na lista de modelos que suportam esforço.
Cache de prompts. Uma leitura do cache custa 0.1x da tarifa base de entrada. O fator relevante para escolher um modelo é o efeito desse custo entre os diferentes níveis. Um cache hit no Opus 4.8 custa $0.50 / MTok, enquanto a entrada sem cache no Haiku 4.5 custa $1 / MTok. Por isso, um prefixo do Opus com bom aproveitamento do cache custa menos por token de entrada do que um prompt do Haiku sem cache. Em qualquer carga de trabalho que reenvie um prefixo grande e estável, a gestão das sessões tem mais impacto do que a escolha do modelo.
Processamento em lote. Se não houver ninguém à espera da resposta, a Message Batches API executa os mesmos modelos com "um desconto de 50% nos tokens de entrada e de saída". Isto reduz para metade todas as linhas da comparação abaixo e funciona entre os diferentes níveis: um trabalho em lote no Opus 4.8 custa menos do que um trabalho síncrono no Sonnet 5 ao preço normal de 1 September 2026, trocando latência por capacidade pelo mesmo valor.
Uma comparação de custos completa
A carga de trabalho: classificar 100,000 emails de suporte, uma chamada por email, com 2,000 tokens de entrada e 300 tokens de saída por chamada. Isso corresponde a 200 MTok de entrada e 30 MTok de saída.
- Haiku 4.5: 200 x $1 = $200 de entrada, 30 x $5 = $150 de saída. Total: $350.
- Sonnet 5, tarifa introdutória: 200 x $2 = $400 de entrada, 30 x $10 = $300 de saída. Total: $700.
- Sonnet 5, a partir de 1 September 2026: 200 x $3 = $600 de entrada, 30 x $15 = $450 de saída. Total: $1,050.
- Opus 4.8: 200 x $5 = $1,000 de entrada, 30 x $25 = $750 de saída. Total: $1,750.
Troque quatro números para refazer o cálculo com os preços de amanhã. Os ajustes abaixo alteram o resultado mais do que o nome do modelo:
- O processamento em lote reduz cada linha para metade: $175, $350, $525 e $875. Nada fica pendente de uma execução noturna de classificação, por isso não há razão para não o fazer.
- Colocar em cache o prefixo partilhado. Suponha que 1,200 dos 2,000 tokens de entrada correspondem ao mesmo bloco de instruções em todas as chamadas. No Sonnet 5, com a tarifa introdutória, esses tokens custam $0.20 / MTok quando são cache hits, em vez de $2 / MTok, por isso 120 MTok custam $24 em vez de $240. Some 80 MTok de entrada nova a $2, ou seja, $160, mais $300 de saída, e o Sonnet 5 fica perto de $484 em vez de $700. A mesma técnica não produz qualquer efeito no Haiku 4.5, porque 1,200 tokens estão abaixo do mínimo de 4,096 tokens.
- Retries. Suponha que rejeita a resposta do Haiku em 8% dos emails e volta a executar esses casos no Opus 4.8. Some 0.08 x $1,750 = $140 aos $350, obtendo $490. Meça a sua própria taxa de rejeição em vez de usar a minha.
- Definições de ferramentas, se o trabalho as utilizar. O system prompt que geram tem 290 tokens no Opus 4.8 com
tool_choicedefinido comoauto, 354 no Sonnet 5 e 496 no Haiku 4.5. O modelo mais barato suporta o maior overhead fixo.
Haiku com um caminho de escalonamento a $490 e Sonnet 5 com cache a $484 têm o mesmo custo, e um deles executa o trabalho numa única passagem. O modelo nunca foi a questão completa.
Mudar de modelo no meio da sessão poupa dinheiro?
Com menos frequência do que os preços anunciados sugerem, porque a poupança é por token e o que fica em risco é todo um prefixo colocado em cache.
A Anthropic documenta o que invalida uma cache. Os prefixos são criados pela ordem tools, depois system e depois messages, e "As alterações em cada nível invalidam esse nível e todos os níveis seguintes." Duas definições do pedido também constam dessa lista: "A configuração de raciocínio e o nível effort resolvido são incorporados no próprio prompt, pelo que alterar qualquer um deles inicia um novo prefixo de cache." Relativamente ao esforço, a documentação é ainda mais clara: "varie o esforço entre cargas de trabalho, não dentro de uma conversa que dependa de acertos na cache".
O modelo não consta dessa lista documentada, por isso não assuma nenhum dos casos. Leia cache_read_input_tokens no primeiro pedido depois de uma mudança e deixe que o número responda. Num prefixo de 150,000 tokens do Opus 4.8, uma leitura da cache custa cerca de $0.08 e uma nova gravação custa cerca de $0.94. Esse valor é superior ao de várias interações da diferença por token que estava a tentar aproveitar.
Por isso, altere estas definições entre tarefas, não dentro da mesma tarefa. No Claude Code, isso significa usar /clear primeiro, quando a cache já está a ser descartada, e depois /model ou /effort. Ambos são introduzidos na CLI. Por isso, se estiver a trabalhar em Linux, o que vale a pena instalar é a versão para terminal, já que o que a Anthropic disponibiliza nativamente para Linux combina uma CLI estável com uma aplicação de desktop ainda em beta. A mudança aparece ou não numa fatura consoante a forma de pagamento da sessão, porque o Claude Code funciona com um plano mensal fixo ou com créditos de API cobrados por token e só a segunda opção atribui um preço em dólares à mudança de modelo. No plano fixo, o custo de usar um modelo mais pesado é o seu período de utilização, não a fatura. Além disso, o Claude Code está incluído a partir do Pro e usa o mesmo período de utilização das aplicações de chat, pelo que uma hora de Opus no terminal é uma hora que não pode usar no browser.
Como testar a resposta na sua própria carga de trabalho
Não dimensione um prompt com base numa contagem obtida de outro modelo. O endpoint de contagem de tokens é gratuito e usa o tokenizador do modelo que indicar. Por isso, indique o modelo que pretende chamar. Esse endpoint é uma das poucas partes da plataforma que nunca gera cobrança. Vale a pena consultar o que mais pode executar sem pagar antes de gastar crédito real numa comparação. Opus 4.7 e versões posteriores, Fable 5 e Sonnet 5 usam um tokenizador mais recente que "produz aproximadamente 30% mais tokens para o mesmo texto". Por isso, um orçamento medido num modelo antigo fica abaixo do necessário num modelo mais recente, se a tarifa por token não mudar.
Depois, leia a resposta recebida. input_tokens representa apenas o restante não armazenado em cache. O tamanho real do prompt é, portanto, a soma desse campo com cache_creation_input_tokens e cache_read_input_tokens. Uma primeira aplicação da API Claude num VPS é o local mais simples e realista para fazer essa medição. Qual plano Claude se adequa ao seu uso é uma decisão separada: determinar se deve pagar por token. Se a questão passar a ser qual subscrição manter, em vez de decidir se deve manter alguma, Os escalões do Claude comparados com os preços do ChatGPT explica quanto custa o mesmo trabalho de programação nos planos do outro fornecedor. Se a medição levar definitivamente o seu trabalho para a API, reduzir a subscrição para um escalão inferior ou cancelá-la continua a dar-lhe acesso ao período que já pagou. Por isso, não há penalização por decidir depois de obter os números. Faça a mesma medição para uma equipa, em vez de uma só pessoa, e o cálculo muda novamente, porque um plano Team ou Enterprise tem de compensar o que essa pessoa teria gasto por token para justificar a compra.
FAQ
Qual é o melhor modelo Claude para programação?
Claude Opus 4.8 é o ponto de partida documentado para programação agentic complexa, a $5 por milhão de tokens de entrada e $25 por milhão de tokens de saída em julho de 2026. Claude Sonnet 5 é apresentado como a melhor combinação de velocidade e inteligência. A $2 / $10 até 31 de agosto de 2026, custa menos de metade. Execute a mesma tarefa nos dois modelos, mantenha constante a configuração de raciocínio e compare o consumo total de tokens a partir de response.usage.
Claude Haiku 4.5 é suficientemente barato para substituir o Sonnet 5?
Por token, sim: $1 / $5 contra $2 / $10 do Sonnet 5 no preço introdutório, ou $3 / $15 a partir de 1 de setembro de 2026. Os limites são o fator decisivo. O Haiku 4.5 tem uma janela de contexto de 200K tokens, em vez de 1M, uma saída máxima de 64K na Messages API síncrona, um limite de conhecimento fiável de fevereiro de 2025, não tem suporte para output_config.effort e exige um prompt cacheável mínimo de 4,096 tokens, o que desativa silenciosamente o cache em prompts de sistema curtos.
Mudar para um modelo Claude mais barato durante uma sessão reduz os custos?
Com menos frequência do que parece. A Anthropic documenta como invalidadores do cache as alterações ao prefixo tools, system ou messages, as alterações à configuração de raciocínio e as alterações a output_config.effort. O efeito da mudança de modelo sobre um cache existente não está documentado. Por isso, trate-o como desconhecido e consulte cache_read_input_tokens no primeiro pedido seguinte. É importante saber o impacto: num prefixo de 150,000 tokens do Opus 4.8, uma leitura do cache custa cerca de $0.08 e uma nova gravação custa cerca de $0.94. Esse valor supera a poupança de vários turnos no custo por token. Mude de modelo entre tarefas, depois de /clear no Claude Code, quando o cache for descartado de qualquer forma.
O que output_config.effort faz ao meu custo?
Altera a quantidade de tokens que o modelo utiliza em texto, chamadas de ferramentas e raciocínio. Um nível de esforço mais baixo gera menos chamadas de ferramentas. Isto tem efeito cumulativo nos ciclos agentic, porque cada resultado de ferramenta é reenviado nos turnos seguintes. Os níveis são low, medium, high, xhigh e max, com high como predefinição. A Anthropic não publica um multiplicador de custo por nível. Classifica o esforço como um sinal comportamental, e não como um orçamento de tokens. Por isso, meça o resultado na sua própria tarefa.
Quanto poupa a Claude Batches API?
50% nos tokens de entrada e de saída, em troca de entrega assíncrona. Em julho de 2026, isso coloca o Opus 4.8 em $2.50 de entrada / $12.50 de saída, o Sonnet 5 em $1 / $5 no preço introdutório e o Haiku 4.5 em $0.50 / $2.50. A comparação mais relevante é entre os níveis: um trabalho do Opus 4.8 em batch custa menos do que um trabalho síncrono do Sonnet 5 à tarifa normal a partir de 1 de setembro de 2026. Assim, o processamento em batch permite usar um modelo mais forte pelo mesmo custo.