SSD Nodes Learn 🎉 VPS desde $4.99/mês
Guias Matt ConnorPor Matt Connor · Atualizado 2026-08-07

Por que o Claude é tão caro? Cálculo de tokens

Tokens de saída custam 5 vezes mais que os de entrada, e cada turno relê o contexto. Veja a conta de uma sessão real e 4 formas de reduzir o custo.

Por que o Claude é caro? A resposta curta

O Claude é caro por quatro razões que se acumulam. Os tokens de saída têm um preço cinco vezes superior ao dos tokens de entrada. A API não mantém memória da sua conversa, por isso todo o histórico é enviado novamente e cobrado novamente em cada turno. Um agente transforma uma pergunta em dezenas de chamadas à API, e cada chamada inclui esse histórico crescente. Além disso, o modelo de fronteira tem um preço baseado na dificuldade do trabalho que executa, e não no custo de executar um modelo pequeno.

Um token é uma parte do texto. Como referência aproximada, um token corresponde a cerca de quatro caracteres ou a cerca de 0.75 palavras em inglês. Os preços são apresentados por milhão de tokens, com a abreviatura MTok (milhão de tokens). Todos os preços abaixo correspondem ao preço publicado da API do Claude em agosto de 2026.

A maioria das faturas inesperadas resulta da segunda e da terceira razões da lista. Normalmente, as pessoas chegam à conclusão de que são as respostas escritas pelo Claude que custam dinheiro. Numa sessão com um agente, o texto gerado representa muitas vezes menos de um décimo da fatura.

As tarifas publicadas, para concordarmos sobre os valores

ChartPublished Claude API rates, US dollars per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5,
    "cache_read_usd": "0.10"
  },
  {
    "label": "Sonnet 5, to Aug 31 2026",
    "input_usd": 2,
    "output_usd": 10,
    "cache_read_usd": "0.20"
  },
  {
    "label": "Sonnet 5, from Sep 1 2026",
    "input_usd": 3,
    "output_usd": 15,
    "cache_read_usd": "0.30"
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25,
    "cache_read_usd": "0.50"
  }
]

Observe a proporção, não os valores absolutos. Todos os modelos cobram exatamente cinco vezes mais pelo output do que pelo input. O Opus 5 custa 5 dólares por milhão de tokens de input e 25 dólares por milhão de tokens de output. O Haiku 4.5 custa 1 e 5. Portanto, a diferença entre o modelo mais barato e o mais caro é de cinco vezes, e a diferença entre ler e escrever também é de cinco vezes.

O Sonnet 5 tem preços introdutórios de 2 e 10 dólares por milhão até 31 de agosto de 2026. A partir de 1 de setembro de 2026, passa para 3 e 15. As tarifas mudam com o lançamento de novos modelos, por isso verifique os valores atuais antes de elaborar um orçamento com base neles.

A última coluna mostra a tarifa de leitura da cache. Ela determina a maior parte das faturas. Voltaremos a este ponto depois dos cálculos.

Por que os tokens de saída custam cinco vezes mais do que os tokens de entrada?

Ler e escrever não exigem a mesma quantidade de trabalho. Os tokens de entrada são processados numa única passagem. O modelo lê todo o prompt de uma vez, e o processamento é executado em paralelo, pelo que um prompt com 60,000 tokens não demora 60,000 vezes mais a ser lido do que um prompt com 1,000 tokens.

Os tokens de saída são produzidos um de cada vez. Cada token novo requer uma passagem própria pelo modelo e precisa de ter como contexto todos os tokens anteriores. Escrever 1,000 tokens significa fazer 1,000 passagens, uma após outra. Esse trabalho sequencial não pode ser distribuído da mesma forma que a leitura, pelo que cada token de saída mantém o hardware ocupado durante mais tempo.

É por isso que "torne a resposta mais curta" é uma medida menos eficaz do que se poderia esperar. Ela atua sobre a metade menor da fatura de um agente.

Por que toda a minha conversa é cobrada novamente em cada turno?

A Claude API não tem estado. Não existe uma conversa no lado da Anthropic à qual seja adicionada uma mensagem. Cada pedido inclui todo o histórico de mensagens, e o modelo lê esse histórico antes de responder. Portanto, o turno 30 é cobrado pelos turnos 1 a 29 também.

Isso significa que o custo de uma conversa cresce mais rapidamente do que o seu comprimento. O turno 1 cobra um contexto pequeno. O turno 40 cobra um contexto grande. Ao somar os 40 turnos, terá pago várias vezes o número de tokens que foram efetivamente escritos.

ChartContext size at each turn of a 40 turn agent session
The data behind this chart
[
  {
    "turn": 1,
    "context_tokens": "20,000"
  },
  {
    "turn": 5,
    "context_tokens": "32,000"
  },
  {
    "turn": 10,
    "context_tokens": "45,000"
  },
  {
    "turn": 15,
    "context_tokens": "55,000"
  },
  {
    "turn": 20,
    "context_tokens": "64,000"
  },
  {
    "turn": 25,
    "context_tokens": "74,000"
  },
  {
    "turn": 30,
    "context_tokens": "84,000"
  },
  {
    "turn": 35,
    "context_tokens": "92,000"
  },
  {
    "turn": 40,
    "context_tokens": "100,000"
  }
]

A sessão acima começa com 20,000 tokens. Isso inclui o prompt do sistema, as definições das ferramentas e os primeiros ficheiros abertos pelo agente. No turno 40, o contexto contém 100,000 tokens. Ao calcular a média ao longo dos 40 turnos, obtém-se aproximadamente 60,000 tokens lidos por pedido.

Porque é que um agente custa muito mais do que um chat?

Num chat, há um pedido por pergunta. Num agente, há um pedido por passo. Ler um ficheiro é um passo. Executar um teste é um passo. Ler o resultado do teste é um passo. Editar o ficheiro é um passo. Quarenta passos para concluir uma tarefa é normal num agente de programação.

A utilização de ferramentas acrescenta dois custos. As definições das ferramentas são tokens de entrada em cada pedido, porque o modelo tem de receber, de cada vez, a informação sobre as ferramentas disponíveis. A Anthropic publica esse overhead: o prompt de sistema de utilização de ferramentas tem 286 tokens no Opus 5 com tool_choice definido como auto, além dos tokens dos seus próprios esquemas de ferramentas. Algumas ferramentas do lado do servidor também têm uma tarifa separada. A pesquisa na Web é faturada a $10 por 1.000 pesquisas, além dos tokens consumidos pelos resultados.

Cada resultado de uma ferramenta também passa a fazer parte permanente do contexto. Um comando que imprime 3.000 linhas coloca essas 3.000 linhas em todos os pedidos seguintes durante o resto da sessão. A utilização de tokens por sessão que o Claude Code apresenta torna isto visível: monitorize o número de entrada e veja-o aumentar imediatamente depois de um comando com muita saída.

A aritmética de uma sessão real

Esta é uma hora realista de programação agentiva no Opus 5. Foram feitas 40 solicitações à API. O contexto cresce de 20,000 para 100,000 tokens, o que dá uma média de cerca de 60,000 tokens por solicitação. O modelo escreve cerca de 700 tokens por solicitação, numa combinação de chamadas curtas a ferramentas e alguns blocos de código mais longos.

Requests in the session:      40
Average context per request:  60,000 tokens

Total input tokens billed:    40 x 60,000                    = 2,400,000
Input cost on Opus 5:         2,400,000 x $5 / 1,000,000     = $12.00

Total output tokens:          40 x 700                       =    28,000
Output cost on Opus 5:        28,000 x $25 / 1,000,000       =  $0.70

Session total                                                = $12.70
ChartWhere the money went in one 40 turn Opus 5 session, no caching
The data behind this chart
[
  {
    "label": "Input, context re-read",
    "billed_tokens": "2,400,000",
    "cost_usd": "12.00"
  },
  {
    "label": "Output, code and tool calls",
    "billed_tokens": "28,000",
    "cost_usd": "0.70"
  }
]

Observe a divisão. O custo da leitura é de 12.00 dólares e o custo da escrita é de 0.70 dólares. Portanto, a saída que você realmente lê corresponde a cerca de cinco por cento da fatura. O modelo escreveu 28,000 tokens e foi cobrado pela leitura de 2,400,000 tokens. Ninguém digitou 2.4 milhões de tokens. Os mesmos 100,000 tokens foram lidos repetidamente.

Alavanca 1: armazenamento em cache de prompts, a maior de todas

O armazenamento em cache de prompts guarda a forma processada de um prefixo estável do seu prompt. No pedido seguinte, esse prefixo é lido da cache em vez de ser processado novamente. Escrever na cache custa 1.25 vezes a tarifa de entrada na cache de cinco minutos ou 2 vezes na cache de uma hora. Ler da cache custa 0.1 vezes a tarifa de entrada. No Opus 5, isso corresponde a 0.50 dólares por milhão, em vez de 5 dólares.

Aplique isso à sessão acima. Cada um dos 100,000 tokens é escrito uma vez na cache à medida que a conversa cresce. Os outros 2,300,000 tokens de entrada tornam-se leituras da cache.

Tokens written to cache:      100,000
Cache write at 1.25x input:   100,000 x $6.25 / 1,000,000    = $0.63

Tokens read from cache:       2,300,000
Cache read at 0.1x input:     2,300,000 x $0.50 / 1,000,000  = $1.15

Output cost, unchanged                                       = $0.70

Session total                                                = $2.48

Marque a parte que pode ser colocada em cache com um campo cache_control. Coloque o ponto de interrupção depois do conteúdo que não muda entre turnos: o prompt do sistema e as definições das ferramentas. Um documento longo que consulta repetidamente deve ficar nesse mesmo bloco estável.

{
  "model": "claude-opus-5",
  "system": [
    {
      "type": "text",
      "text": "<long, stable instructions>",
      "cache_control": {"type": "ephemeral"}
    }
  ],
  "messages": [{"role": "user", "content": "..."}]
}

A ordem do prompt passa a determinar o custo. Um acerto da cache exige uma correspondência exata desde o início do prompt. Por isso, tudo o que muda em cada pedido deve ficar depois de tudo o que não muda. Se colocar um timestamp no início do prompt do sistema, quebra a cache em todos os turnos: todo o prefixo torna-se uma falha de cache, e paga 1.25 vezes a tarifa de entrada para o escrever novamente.

A resposta indica se funcionou. Envie um pedido e leia o bloco de utilização.

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 256,
    "messages": [{"role": "user", "content": "Hello"}]
  }'

Todas as respostas incluem um objeto usage como este:

{
  "usage": {
    "input_tokens": 105,
    "cache_creation_input_tokens": 7345,
    "cache_read_input_tokens": 7123,
    "output_tokens": 239
  }
}

Um pedido repetido que ainda mostre 0 em cache_read_input_tokens significa que a cache não está a ser utilizada. A causa habitual é alguma alteração antes do seu ponto de interrupção. A cache de cinco minutos também expira. Por isso, um pedido enviado seis minutos depois resulta numa falha de cache seguida de uma nova escrita.

Alavanca 2: encaminhe as tarefas simples para um modelo menor

A maioria das interações numa sessão de agente não é difícil. Abrir um ficheiro, executar um formatador, ler um diff. Essas tarefas não precisam do modelo de fronteira. Encaminhá-las para o Haiku 4.5 reduz a tarifa de entrada de 5 dólares por milhão para 1.

ChartThe same 40 turn session under four setups, US dollars
The data behind this chart
[
  {
    "label": "Opus 5, no caching",
    "session_cost_usd": "12.70"
  },
  {
    "label": "Opus 5, cached",
    "session_cost_usd": "2.48"
  },
  {
    "label": "Sonnet 5, cached",
    "session_cost_usd": "0.99"
  },
  {
    "label": "Haiku 4.5, cached",
    "session_cost_usd": "0.50"
  }
]

A mesma sessão custa 12.70 dólares no Opus 5 sem caching, 2.48 com caching, 0.99 no Sonnet 5 com caching e 0.50 no Haiku 4.5 com caching. O caching, por si só, elimina cerca de oitenta por cento da fatura. A escolha do modelo elimina a maior parte do valor restante.

Esta é a ressalva importante. Um modelo mais barato que dá uma resposta errada faz com que tenha de repetir toda a sessão, além de consumir o seu próprio tempo. Encaminhe as tarefas de acordo com a dificuldade, não com o preço. Escolher entre Opus, Sonnet e Haiku explica em que situações cada modelo é adequado.

Higiene do contexto

Cada token que permanece no contexto é faturado em todos os turnos restantes. Por isso, remover um token cedo vale muito mais do que removê-lo tarde. Um ficheiro com 5,000 tokens, inserido no turno 5 de uma sessão com 40 turnos, será lido mais 35 vezes. Isso representa 175,000 tokens de entrada adicionais, quase um dólar no Opus 5, devido a uma única colagem descuidada.

Quatro hábitos que alteram este valor:

  • Inicie uma sessão nova para cada tarefa nova, em vez de continuar a sessão de ontem.
  • Filtre os comandos ruidosos antes de a saída chegar ao modelo, usando algo como head -50, e não depois.
  • Peça apenas a função de que precisa, não o ficheiro inteiro.
  • Quando uma sessão longa deixar de avançar, peça um resumo e recomece a partir dele. O resumo tem algumas centenas de tokens. A transcrição tem cem mil.

Alavanca 4: processe em lote tudo o que não for interativo

A Batch API processa pedidos de forma assíncrona e reduz em 50 percent o custo dos tokens de entrada e de saída. Se uma tarefa não precisar de uma resposta no segundo seguinte, processe-a em lote. Isto inclui classificação, extração, resumo de um backlog e execuções de avaliação. O desconto do processamento em lote acumula-se com o prompt caching. Não se aplica a uma sessão interativa, porque não há nada por que esperar.

Estou a pagar mais do que devia?

Essa é a verdadeira questão por trás de "porque é que o Claude é caro", por isso a resposta direta é esta. As tarifas são públicas, são iguais para todos nos níveis padrão e são cobradas por token. Nada na fatura é discricionário. O tarifário não pode dizer-lhe se está a obter valor, porque define o preço dos tokens e o que lhe interessa são os resultados.

Por isso, avalie o preço do resultado. A sessão acima custou 12.70 dólares sem cache. Se produziu uma funcionalidade que lhe teria levado uma hora a desenvolver, foi barata. Se passou quarenta turnos a andar em círculos, os mesmos 12.70 dólares não produziram nada, e a tarifa nunca foi o problema.

Esta é a parte que vale a pena recordar. A sua fatura aumenta com o número de tokens, não com o valor. Uma sessão produtiva e uma sessão desperdiçada com a mesma duração custam o mesmo. É por isso que os quatro fatores de controlo são mais importantes do que o tarifário: não pode negociar o preço por token, mas decide quantos tokens o trabalho exige.

Por isso, acompanhe os dólares por tarefa concluída, não os dólares por mês. Se esse valor diminuir enquanto ajusta o caching e o encaminhamento, a sua configuração está a melhorar mesmo quando o total mensal aumenta, porque esse aumento resulta da execução de mais trabalho.

O que não reduz a sua fatura

Algumas recomendações populares têm pouco efeito. Dizer ao modelo para "ser conciso" reduz o tamanho da resposta, mas as respostas representavam cinco por cento da fatura de exemplo. Encurtar a sua própria pergunta poupa algumas centenas de tokens num contexto de 60,000 tokens. Desativar o extended thinking só ajuda quando os tokens de raciocínio representavam uma parte significativa da resposta. O bloco de utilização mostra se esse é o caso, sem precisar de adivinhar.

Uma janela de contexto maior também não aumenta o custo por si só. No Claude 4.6 e posteriores, a janela completa de um milhão de tokens é faturada à tarifa normal por token. Por isso, um pedido com 900,000 tokens tem o mesmo custo por token que um pedido com 9,000 tokens. O tamanho da janela não define o preço. O preço depende do que escolher colocar na janela.

Mais duas questões devem ser tratadas no planeamento, e não numa única sessão. Se a utilização for diária e interativa, compare o pagamento por token com um plano de preço fixo: a comparação entre os custos da API e da subscrição apresenta esse cálculo. Se um agente executar tarefas sem supervisão num servidor, defina um limite máximo de despesas antes de ajustar qualquer outra coisa. É disso que trata o controlo de custos de um agente de IA num VPS. Para ter uma noção simples da escala, o que um milhão de tokens do Claude compra realmente converte a tabela de preços em páginas de texto.

FAQ

Porque aumentou tanto a minha fatura do Claude quando comecei a usar um agente?

Porque um agente envia muitos pedidos por pergunta e cada pedido inclui todo o histórico da conversa até esse momento. Um chat envia um pedido por pergunta. Um agente de programação envia um pedido por passo, e quarenta passos para uma tarefa é normal. Cada um desses pedidos é faturado com todo o contexto. Por isso, uma sessão que termina com 100,000 tokens pode ser faturada por mais de dois milhões de tokens de entrada no total. Consulte input_tokens e cache_read_input_tokens na resposta da API para ver isso diretamente.

O armazenamento em cache de prompts reduz mesmo tanto a fatura?

No exemplo detalhado, reduziu o custo da sessão de 12.70 dólares para 2.48 dólares, porque uma leitura da cache custa um décimo da tarifa de entrada. A poupança depende inteiramente da sua taxa de acerto. Com a cache de cinco minutos, o custo compensa-se depois de uma única leitura, porque a gravação custa 1.25 vezes a entrada e a leitura custa 0.1 vezes. Se o seu prompt mudar perto do início em todos os pedidos, não terá qualquer acerto e pagará sem benefício o custo adicional da gravação. Confirme com cache_read_input_tokens antes de assumir que está a funcionar.

Devo simplesmente usar Haiku para tudo?

Não. Haiku 4.5 custa 1 dólares por milhão de tokens de entrada, contra 5 para Opus 5. Por isso, a poupança é real em tarefas simples e de grande volume, como classificação e encaminhamento. Uma resposta errada numa tarefa difícil custa mais do que o modelo poupou, porque, além do custo da nova tentativa, também paga com o seu próprio tempo. O padrão que funciona é misto: o modelo pequeno para operações mecânicas e o modelo de ponta para o passo que exige avaliação.

A API é mais barata do que uma subscrição do Claude?

Depende da regularidade da sua utilização. Uma subscrição tem um preço mensal fixo associado a limites de utilização. A API é faturada por token e não tem um limite superior. É mais barata quando a utilização é reduzida ou ocorre em picos, e mais cara quando a utiliza intensivamente em todos os dias úteis. Obtenha no bloco de utilização a média de tokens por dia, calcule o preço com a tarifa do seu modelo e compare esse valor com o preço do plano.