Por que o Claude é tão caro? Cálculo de tokens
Tokens de saída custam 5 vezes mais que os de entrada, e cada turno relê o contexto. Veja a conta de uma sessão real e 4 formas de reduzir o custo.
Por que o Claude é caro? A resposta curta
O Claude é caro por quatro razões que se acumulam. Os tokens de saída têm um preço cinco vezes superior ao dos tokens de entrada. A API não mantém memória da sua conversa, por isso todo o histórico é enviado novamente e cobrado novamente em cada turno. Um agente transforma uma pergunta em dezenas de chamadas à API, e cada chamada inclui esse histórico crescente. Além disso, o modelo de fronteira tem um preço baseado na dificuldade do trabalho que executa, e não no custo de executar um modelo pequeno.
Um token é uma parte do texto. Como referência aproximada, um token corresponde a cerca de quatro caracteres ou a cerca de 0.75 palavras em inglês. Os preços são apresentados por milhão de tokens, com a abreviatura MTok (milhão de tokens). Todos os preços abaixo correspondem ao preço publicado da API do Claude em agosto de 2026.
A maioria das faturas inesperadas resulta da segunda e da terceira razões da lista. Normalmente, as pessoas chegam à conclusão de que são as respostas escritas pelo Claude que custam dinheiro. Numa sessão com um agente, o texto gerado representa muitas vezes menos de um décimo da fatura.
As tarifas publicadas, para concordarmos sobre os valores
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5,
"cache_read_usd": "0.10"
},
{
"label": "Sonnet 5, to Aug 31 2026",
"input_usd": 2,
"output_usd": 10,
"cache_read_usd": "0.20"
},
{
"label": "Sonnet 5, from Sep 1 2026",
"input_usd": 3,
"output_usd": 15,
"cache_read_usd": "0.30"
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25,
"cache_read_usd": "0.50"
}
]Observe a proporção, não os valores absolutos. Todos os modelos cobram exatamente cinco vezes mais pelo output do que pelo input. O Opus 5 custa 5 dólares por milhão de tokens de input e 25 dólares por milhão de tokens de output. O Haiku 4.5 custa 1 e 5. Portanto, a diferença entre o modelo mais barato e o mais caro é de cinco vezes, e a diferença entre ler e escrever também é de cinco vezes.
O Sonnet 5 tem preços introdutórios de 2 e 10 dólares por milhão até 31 de agosto de 2026. A partir de 1 de setembro de 2026, passa para 3 e 15. As tarifas mudam com o lançamento de novos modelos, por isso verifique os valores atuais antes de elaborar um orçamento com base neles.
A última coluna mostra a tarifa de leitura da cache. Ela determina a maior parte das faturas. Voltaremos a este ponto depois dos cálculos.
Por que os tokens de saída custam cinco vezes mais do que os tokens de entrada?
Ler e escrever não exigem a mesma quantidade de trabalho. Os tokens de entrada são processados numa única passagem. O modelo lê todo o prompt de uma vez, e o processamento é executado em paralelo, pelo que um prompt com 60,000 tokens não demora 60,000 vezes mais a ser lido do que um prompt com 1,000 tokens.
Os tokens de saída são produzidos um de cada vez. Cada token novo requer uma passagem própria pelo modelo e precisa de ter como contexto todos os tokens anteriores. Escrever 1,000 tokens significa fazer 1,000 passagens, uma após outra. Esse trabalho sequencial não pode ser distribuído da mesma forma que a leitura, pelo que cada token de saída mantém o hardware ocupado durante mais tempo.
É por isso que "torne a resposta mais curta" é uma medida menos eficaz do que se poderia esperar. Ela atua sobre a metade menor da fatura de um agente.
Por que toda a minha conversa é cobrada novamente em cada turno?
A Claude API não tem estado. Não existe uma conversa no lado da Anthropic à qual seja adicionada uma mensagem. Cada pedido inclui todo o histórico de mensagens, e o modelo lê esse histórico antes de responder. Portanto, o turno 30 é cobrado pelos turnos 1 a 29 também.
Isso significa que o custo de uma conversa cresce mais rapidamente do que o seu comprimento. O turno 1 cobra um contexto pequeno. O turno 40 cobra um contexto grande. Ao somar os 40 turnos, terá pago várias vezes o número de tokens que foram efetivamente escritos.
The data behind this chart
[
{
"turn": 1,
"context_tokens": "20,000"
},
{
"turn": 5,
"context_tokens": "32,000"
},
{
"turn": 10,
"context_tokens": "45,000"
},
{
"turn": 15,
"context_tokens": "55,000"
},
{
"turn": 20,
"context_tokens": "64,000"
},
{
"turn": 25,
"context_tokens": "74,000"
},
{
"turn": 30,
"context_tokens": "84,000"
},
{
"turn": 35,
"context_tokens": "92,000"
},
{
"turn": 40,
"context_tokens": "100,000"
}
]A sessão acima começa com 20,000 tokens. Isso inclui o prompt do sistema, as definições das ferramentas e os primeiros ficheiros abertos pelo agente. No turno 40, o contexto contém 100,000 tokens. Ao calcular a média ao longo dos 40 turnos, obtém-se aproximadamente 60,000 tokens lidos por pedido.
Porque é que um agente custa muito mais do que um chat?
Num chat, há um pedido por pergunta. Num agente, há um pedido por passo. Ler um ficheiro é um passo. Executar um teste é um passo. Ler o resultado do teste é um passo. Editar o ficheiro é um passo. Quarenta passos para concluir uma tarefa é normal num agente de programação.
A utilização de ferramentas acrescenta dois custos. As definições das ferramentas são tokens de entrada em cada pedido, porque o modelo tem de receber, de cada vez, a informação sobre as ferramentas disponíveis. A Anthropic publica esse overhead: o prompt de sistema de utilização de ferramentas tem 286 tokens no Opus 5 com tool_choice definido como auto, além dos tokens dos seus próprios esquemas de ferramentas. Algumas ferramentas do lado do servidor também têm uma tarifa separada. A pesquisa na Web é faturada a $10 por 1.000 pesquisas, além dos tokens consumidos pelos resultados.
Cada resultado de uma ferramenta também passa a fazer parte permanente do contexto. Um comando que imprime 3.000 linhas coloca essas 3.000 linhas em todos os pedidos seguintes durante o resto da sessão. A utilização de tokens por sessão que o Claude Code apresenta torna isto visível: monitorize o número de entrada e veja-o aumentar imediatamente depois de um comando com muita saída.
A aritmética de uma sessão real
Esta é uma hora realista de programação agentiva no Opus 5. Foram feitas 40 solicitações à API. O contexto cresce de 20,000 para 100,000 tokens, o que dá uma média de cerca de 60,000 tokens por solicitação. O modelo escreve cerca de 700 tokens por solicitação, numa combinação de chamadas curtas a ferramentas e alguns blocos de código mais longos.
Requests in the session: 40
Average context per request: 60,000 tokens
Total input tokens billed: 40 x 60,000 = 2,400,000
Input cost on Opus 5: 2,400,000 x $5 / 1,000,000 = $12.00
Total output tokens: 40 x 700 = 28,000
Output cost on Opus 5: 28,000 x $25 / 1,000,000 = $0.70
Session total = $12.70The data behind this chart
[
{
"label": "Input, context re-read",
"billed_tokens": "2,400,000",
"cost_usd": "12.00"
},
{
"label": "Output, code and tool calls",
"billed_tokens": "28,000",
"cost_usd": "0.70"
}
]Observe a divisão. O custo da leitura é de 12.00 dólares e o custo da escrita é de 0.70 dólares. Portanto, a saída que você realmente lê corresponde a cerca de cinco por cento da fatura. O modelo escreveu 28,000 tokens e foi cobrado pela leitura de 2,400,000 tokens. Ninguém digitou 2.4 milhões de tokens. Os mesmos 100,000 tokens foram lidos repetidamente.
Alavanca 1: armazenamento em cache de prompts, a maior de todas
O armazenamento em cache de prompts guarda a forma processada de um prefixo estável do seu prompt. No pedido seguinte, esse prefixo é lido da cache em vez de ser processado novamente. Escrever na cache custa 1.25 vezes a tarifa de entrada na cache de cinco minutos ou 2 vezes na cache de uma hora. Ler da cache custa 0.1 vezes a tarifa de entrada. No Opus 5, isso corresponde a 0.50 dólares por milhão, em vez de 5 dólares.
Aplique isso à sessão acima. Cada um dos 100,000 tokens é escrito uma vez na cache à medida que a conversa cresce. Os outros 2,300,000 tokens de entrada tornam-se leituras da cache.
Tokens written to cache: 100,000
Cache write at 1.25x input: 100,000 x $6.25 / 1,000,000 = $0.63
Tokens read from cache: 2,300,000
Cache read at 0.1x input: 2,300,000 x $0.50 / 1,000,000 = $1.15
Output cost, unchanged = $0.70
Session total = $2.48Marque a parte que pode ser colocada em cache com um campo cache_control. Coloque o ponto de interrupção depois do conteúdo que não muda entre turnos: o prompt do sistema e as definições das ferramentas. Um documento longo que consulta repetidamente deve ficar nesse mesmo bloco estável.
{
"model": "claude-opus-5",
"system": [
{
"type": "text",
"text": "<long, stable instructions>",
"cache_control": {"type": "ephemeral"}
}
],
"messages": [{"role": "user", "content": "..."}]
}A ordem do prompt passa a determinar o custo. Um acerto da cache exige uma correspondência exata desde o início do prompt. Por isso, tudo o que muda em cada pedido deve ficar depois de tudo o que não muda. Se colocar um timestamp no início do prompt do sistema, quebra a cache em todos os turnos: todo o prefixo torna-se uma falha de cache, e paga 1.25 vezes a tarifa de entrada para o escrever novamente.
A resposta indica se funcionou. Envie um pedido e leia o bloco de utilização.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-opus-5",
"max_tokens": 256,
"messages": [{"role": "user", "content": "Hello"}]
}'Todas as respostas incluem um objeto usage como este:
{
"usage": {
"input_tokens": 105,
"cache_creation_input_tokens": 7345,
"cache_read_input_tokens": 7123,
"output_tokens": 239
}
}Um pedido repetido que ainda mostre 0 em cache_read_input_tokens significa que a cache não está a ser utilizada. A causa habitual é alguma alteração antes do seu ponto de interrupção. A cache de cinco minutos também expira. Por isso, um pedido enviado seis minutos depois resulta numa falha de cache seguida de uma nova escrita.
Alavanca 2: encaminhe as tarefas simples para um modelo menor
A maioria das interações numa sessão de agente não é difícil. Abrir um ficheiro, executar um formatador, ler um diff. Essas tarefas não precisam do modelo de fronteira. Encaminhá-las para o Haiku 4.5 reduz a tarifa de entrada de 5 dólares por milhão para 1.
The data behind this chart
[
{
"label": "Opus 5, no caching",
"session_cost_usd": "12.70"
},
{
"label": "Opus 5, cached",
"session_cost_usd": "2.48"
},
{
"label": "Sonnet 5, cached",
"session_cost_usd": "0.99"
},
{
"label": "Haiku 4.5, cached",
"session_cost_usd": "0.50"
}
]A mesma sessão custa 12.70 dólares no Opus 5 sem caching, 2.48 com caching, 0.99 no Sonnet 5 com caching e 0.50 no Haiku 4.5 com caching. O caching, por si só, elimina cerca de oitenta por cento da fatura. A escolha do modelo elimina a maior parte do valor restante.
Esta é a ressalva importante. Um modelo mais barato que dá uma resposta errada faz com que tenha de repetir toda a sessão, além de consumir o seu próprio tempo. Encaminhe as tarefas de acordo com a dificuldade, não com o preço. Escolher entre Opus, Sonnet e Haiku explica em que situações cada modelo é adequado.
Higiene do contexto
Cada token que permanece no contexto é faturado em todos os turnos restantes. Por isso, remover um token cedo vale muito mais do que removê-lo tarde. Um ficheiro com 5,000 tokens, inserido no turno 5 de uma sessão com 40 turnos, será lido mais 35 vezes. Isso representa 175,000 tokens de entrada adicionais, quase um dólar no Opus 5, devido a uma única colagem descuidada.
Quatro hábitos que alteram este valor:
- Inicie uma sessão nova para cada tarefa nova, em vez de continuar a sessão de ontem.
- Filtre os comandos ruidosos antes de a saída chegar ao modelo, usando algo como
head -50, e não depois. - Peça apenas a função de que precisa, não o ficheiro inteiro.
- Quando uma sessão longa deixar de avançar, peça um resumo e recomece a partir dele. O resumo tem algumas centenas de tokens. A transcrição tem cem mil.
Alavanca 4: processe em lote tudo o que não for interativo
A Batch API processa pedidos de forma assíncrona e reduz em 50 percent o custo dos tokens de entrada e de saída. Se uma tarefa não precisar de uma resposta no segundo seguinte, processe-a em lote. Isto inclui classificação, extração, resumo de um backlog e execuções de avaliação. O desconto do processamento em lote acumula-se com o prompt caching. Não se aplica a uma sessão interativa, porque não há nada por que esperar.
Estou a pagar mais do que devia?
Essa é a verdadeira questão por trás de "porque é que o Claude é caro", por isso a resposta direta é esta. As tarifas são públicas, são iguais para todos nos níveis padrão e são cobradas por token. Nada na fatura é discricionário. O tarifário não pode dizer-lhe se está a obter valor, porque define o preço dos tokens e o que lhe interessa são os resultados.
Por isso, avalie o preço do resultado. A sessão acima custou 12.70 dólares sem cache. Se produziu uma funcionalidade que lhe teria levado uma hora a desenvolver, foi barata. Se passou quarenta turnos a andar em círculos, os mesmos 12.70 dólares não produziram nada, e a tarifa nunca foi o problema.
Esta é a parte que vale a pena recordar. A sua fatura aumenta com o número de tokens, não com o valor. Uma sessão produtiva e uma sessão desperdiçada com a mesma duração custam o mesmo. É por isso que os quatro fatores de controlo são mais importantes do que o tarifário: não pode negociar o preço por token, mas decide quantos tokens o trabalho exige.
Por isso, acompanhe os dólares por tarefa concluída, não os dólares por mês. Se esse valor diminuir enquanto ajusta o caching e o encaminhamento, a sua configuração está a melhorar mesmo quando o total mensal aumenta, porque esse aumento resulta da execução de mais trabalho.
O que não reduz a sua fatura
Algumas recomendações populares têm pouco efeito. Dizer ao modelo para "ser conciso" reduz o tamanho da resposta, mas as respostas representavam cinco por cento da fatura de exemplo. Encurtar a sua própria pergunta poupa algumas centenas de tokens num contexto de 60,000 tokens. Desativar o extended thinking só ajuda quando os tokens de raciocínio representavam uma parte significativa da resposta. O bloco de utilização mostra se esse é o caso, sem precisar de adivinhar.
Uma janela de contexto maior também não aumenta o custo por si só. No Claude 4.6 e posteriores, a janela completa de um milhão de tokens é faturada à tarifa normal por token. Por isso, um pedido com 900,000 tokens tem o mesmo custo por token que um pedido com 9,000 tokens. O tamanho da janela não define o preço. O preço depende do que escolher colocar na janela.
Mais duas questões devem ser tratadas no planeamento, e não numa única sessão. Se a utilização for diária e interativa, compare o pagamento por token com um plano de preço fixo: a comparação entre os custos da API e da subscrição apresenta esse cálculo. Se um agente executar tarefas sem supervisão num servidor, defina um limite máximo de despesas antes de ajustar qualquer outra coisa. É disso que trata o controlo de custos de um agente de IA num VPS. Para ter uma noção simples da escala, o que um milhão de tokens do Claude compra realmente converte a tabela de preços em páginas de texto.
FAQ
Porque aumentou tanto a minha fatura do Claude quando comecei a usar um agente?
Porque um agente envia muitos pedidos por pergunta e cada pedido inclui todo o histórico da conversa até esse momento. Um chat envia um pedido por pergunta. Um agente de programação envia um pedido por passo, e quarenta passos para uma tarefa é normal. Cada um desses pedidos é faturado com todo o contexto. Por isso, uma sessão que termina com 100,000 tokens pode ser faturada por mais de dois milhões de tokens de entrada no total. Consulte input_tokens e cache_read_input_tokens na resposta da API para ver isso diretamente.
O armazenamento em cache de prompts reduz mesmo tanto a fatura?
No exemplo detalhado, reduziu o custo da sessão de 12.70 dólares para 2.48 dólares, porque uma leitura da cache custa um décimo da tarifa de entrada. A poupança depende inteiramente da sua taxa de acerto. Com a cache de cinco minutos, o custo compensa-se depois de uma única leitura, porque a gravação custa 1.25 vezes a entrada e a leitura custa 0.1 vezes. Se o seu prompt mudar perto do início em todos os pedidos, não terá qualquer acerto e pagará sem benefício o custo adicional da gravação. Confirme com cache_read_input_tokens antes de assumir que está a funcionar.
Devo simplesmente usar Haiku para tudo?
Não. Haiku 4.5 custa 1 dólares por milhão de tokens de entrada, contra 5 para Opus 5. Por isso, a poupança é real em tarefas simples e de grande volume, como classificação e encaminhamento. Uma resposta errada numa tarefa difícil custa mais do que o modelo poupou, porque, além do custo da nova tentativa, também paga com o seu próprio tempo. O padrão que funciona é misto: o modelo pequeno para operações mecânicas e o modelo de ponta para o passo que exige avaliação.
A API é mais barata do que uma subscrição do Claude?
Depende da regularidade da sua utilização. Uma subscrição tem um preço mensal fixo associado a limites de utilização. A API é faturada por token e não tem um limite superior. É mais barata quando a utilização é reduzida ou ocorre em picos, e mais cara quando a utiliza intensivamente em todos os dias úteis. Obtenha no bloco de utilização a média de tokens por dia, calcule o preço com a tarifa do seu modelo e compare esse valor com o preço do plano.