SSD Nodes Learn 🎉 VPS desde $4.99/mês
Guias Matt ConnorPor Matt Connor · Atualizado 2026-08-07

Quanto custa 1 milhão de tokens no Claude?

Veja quanto custa 1 milhão de tokens no Claude: entrada e saída têm preços separados, e a saída custa 5 vezes mais em todos os modelos atuais.

Quanto custam 1M tokens no Claude?

1M tokens significa um milhão de tokens e é a unidade usada para apresentar os preços de todas as APIs do Claude (interface de programação de aplicações). Não existe um preço único, porque os tokens de entrada e de saída são faturados a taxas diferentes e cada modelo tem o seu próprio par de preços. Em agosto de 2026, um milhão de tokens de entrada custa $1 no Claude Haiku 4.5, $2 no Claude Sonnet 5 e $5 no Claude Opus 5.

A saída é a parte mais cara. Em todos os modelos atuais, a taxa de saída é cinco vezes superior à taxa de entrada. Por isso, a proporção entre as duas determina a sua fatura mais do que o valor de referência. Uma aplicação que envia documentos longos e devolve respostas curtas tem um comportamento de custos muito diferente de uma aplicação que escreve respostas longas a partir de um prompt curto.

Esta página explica a economia por unidade: quanto custa um token e como estimar uma fatura antes de desenvolver. Para saber para onde os tokens vão durante o trabalho, leia para onde vão os tokens numa sessão do Claude Code.

Como são 1M de tokens

Um token é um fragmento de texto que o modelo lê ou escreve. A estimativa aproximada da Anthropic é de 1 token por cada 4 caracteres, ou cerca de 0,75 palavras em inglês. 1 milhão de tokens corresponde, portanto, a cerca de 750.000 palavras, ou aproximadamente 4 MB de texto simples.

As estimativas publicadas para entradas comuns ajudam a ter uma noção melhor da escala.

ChartApproximate input token counts for common content, published estimates
The data behind this chart
[
  {
    "label": "Average web page (10 kB)",
    "tokens": "2,500"
  },
  {
    "label": "Documentation page (100 kB)",
    "tokens": "25,000"
  },
  {
    "label": "Research paper PDF (500 kB)",
    "tokens": "125,000"
  }
]

Com essas taxas, 1M de tokens corresponde a cerca de 400 páginas Web médias lidas uma vez, ou a oito artigos de investigação desse tamanho. Equivale a uma passagem por uma base de código de dimensão média, ou a um mês de utilização ligeira de chat por uma pessoa.

Considere tudo isto uma estimativa. Código, JSON e texto em idiomas diferentes do inglês contêm menos palavras por token, por isso a proporção de 0,75 representa o limite otimista. Há outro fator que altera a contagem: Claude Opus 4.7 e versões posteriores, incluindo Opus 5 e Sonnet 5, usam um tokenizador mais recente que produz aproximadamente 30 por cento mais tokens para o mesmo texto do que Sonnet 4.6 e versões anteriores. Claude Haiku 4.5 usa o tokenizador antigo. Assim, uma contagem medida no Haiku 4.5 subestima a contagem no Sonnet 5 para uma entrada idêntica, o que significa que uma comparação direta do preço por milhão entre essas versões não é justa. Conte o mesmo prompt nos dois modelos antes de decidir.

Valores cobrados pelo Claude por milhão de tokens

ChartClaude API list price in USD per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5
  },
  {
    "label": "Sonnet 5 (to 31 Aug 2026)",
    "input_usd": 2,
    "output_usd": 10
  },
  {
    "label": "Sonnet 5 (from 1 Sep 2026)",
    "input_usd": 3,
    "output_usd": 15
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25
  }
]

O Claude Sonnet 5 está com preços introdutórios de $2 para entrada e $10 para saída até 31 August 2026. A partir de 1 September 2026, aplica-se a tarifa padrão: $3 para entrada e $15 para saída. O Claude Opus 5 custa $5 para entrada e $25 para saída.

As tarifas mudam. Considere todos os valores desta página como um exemplo calculado em August 2026 e confirme os valores atuais na página oficial de preços antes de aprovar um orçamento.

O comprimento do contexto não altera a tarifa. No Claude 4.6 e posteriores, a janela de contexto completa de 1M de tokens é faturada segundo o preço padrão. Por isso, um pedido com 900,000 tokens custa o mesmo por token que um pedido com 9,000 tokens. Um prompt longo custa mais porque contém mais tokens. Não se aplica uma tarifa separada para contextos longos.

A aritmética que continua correta depois de uma alteração de preço

Cada fatura resulta de duas multiplicações e uma adição.

cost = (input_tokens  / 1,000,000) * input_rate
     + (output_tokens / 1,000,000) * output_rate

Escrito como código que pode executar:

INPUT_RATE = 2.00    # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00  # USD per million output tokens

def cost(input_tokens, output_tokens):
    return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000

print(f"{cost(4300, 400):.4f}")

Isto imprime 0.0126. Um pedido que envia 4,300 tokens de entrada e recebe 400 tokens de saída custa cerca de 1,3 cêntimos no Sonnet 5. Mantenha as duas tarifas num único local do código. Quando um preço muda, edite duas linhas e todas as estimativas do sistema são atualizadas.

Uma estimativa prática para uma aplicação real

Considere um assistente de suporte. O prompt do sistema e a documentação do produto totalizam 4,000 tokens e são enviados em todos os pedidos, porque a Messages API não mantém estado e o modelo não se lembra de nada entre chamadas. Uma pergunta do utilizador acrescenta cerca de 300 tokens. Uma resposta tem cerca de 400. São 4,300 tokens de entrada e 400 de saída por pedido.

Um milhão de tokens de entrada permite cerca de 232 pedidos desse tipo. Com 1,000 pedidos por dia, a aplicação consome 4.3 milhões de tokens de entrada diariamente. Portanto, "1M tokens" representa menos de seis horas de tráfego.

ChartEstimated cost per 1,000 requests at 4,300 input and 400 output tokens
The data behind this chart
[
  {
    "label": "Opus 5, list rates",
    "cost_per_1k_usd": "31.50"
  },
  {
    "label": "Sonnet 5, list rates",
    "cost_per_1k_usd": "12.60"
  },
  {
    "label": "Sonnet 5, Batch API",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Haiku 4.5, list rates",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Sonnet 5, warm prompt cache",
    "cost_per_1k_usd": "5.40"
  }
]

No Claude Opus 5, esse tráfego custa $31.50 por 1,000 pedidos. No Sonnet 5, custa $12.60. A mudança para Claude Haiku 4.5 reduz o custo para $6.30, e uma cache de prompts aquecida no Sonnet 5 reduz-no ainda mais, para $5.40.

Multiplique por 30 para obter o custo de um mês com esse tráfego. O Sonnet 5, com os preços de tabela, custa cerca de $378 por mês. A mesma aplicação com uma cache aquecida custa cerca de $162. A escolha do modelo e a decisão de usar cache têm, cada uma, mais impacto do que qualquer preço que consiga negociar neste volume. A escolha do modelo a executar é uma questão separada, e vence o modelo mais barato que passe pelas suas avaliações: escolher entre Opus, Sonnet e Haiku explica como testar isso corretamente.

O cache de prompts reduz o custo da parte repetida

Esse prefixo de 4,000 tokens é idêntico em todos os pedidos, mas paga o preço total da entrada por ele todas as vezes. O cache de prompts armazena o prefixo processado e aplica uma tarifa reduzida quando ele é reutilizado.

Uma leitura do cache custa 0.1 vezes a tarifa base de entrada. A gravação no cache custa 1.25 vezes a tarifa base durante a validade de 5 minutos, ou 2 vezes a tarifa base durante a validade de 1 hora. Portanto, o cache de 5 minutos compensa após uma leitura, porque a gravação custa mais 0.25, enquanto cada leitura poupa 0.9. O cache de 1 hora precisa de duas leituras para atingir o ponto de equilíbrio.

A forma mais simples de o ativar é usar um único campo de nível superior:

curl https://api.anthropic.com/v1/messages \
  -H "content-type: application/json" \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "You are a helpful assistant.",
    "messages": [
      {"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
    ]
  }'

Em seguida, leia o bloco usage devolvido:

{
  "usage": {
    "cache_creation_input_tokens": 5120,
    "cache_read_input_tokens": 1800,
    "input_tokens": 50,
    "output_tokens": 503
  }
}

Esses três contadores de entrada são cobrados com três tarifas diferentes e somam o seu volume real de entrada: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens. Uma estimativa de custo que leia apenas input_tokens ficará muito errada quando o cache estiver ativado.

Há duas situações que impedem o cache de compensar, e ambas falham silenciosamente.

O prefixo tem de ser idêntico ao nível de bytes. A consulta ao cache procura uma correspondência de prefixo. Portanto, um timestamp ou o nome do utilizador no início do system prompt altera o prefixo em todos os pedidos. Nesse caso, paga 1.25 vezes a tarifa base de entrada todas as vezes e nunca faz uma leitura. O sintoma é cache_creation_input_tokens permanecer elevado enquanto cache_read_input_tokens permanece em 0. Coloque cache_control no último bloco cujo conteúdo é igual em todos os pedidos e coloque depois dele tudo o que varia. Alterar as definições de tools invalida todo o cache abaixo delas, porque a invalidação percorre a ordem tools, depois system e, por fim, messages.

O prefixo tem de ser suficientemente longo. O comprimento mínimo que pode ser colocado em cache é de 512 tokens no Opus 5, 1,024 no Sonnet 5 e 4,096 no Haiku 4.5. Um prompt mais curto não é colocado em cache e nenhum erro é devolvido. O prefixo de 4,000 tokens do exemplo anterior é colocado em cache no Sonnet 5, mas não no Haiku 4.5, porque 4,000 fica abaixo do limite mínimo desse modelo. Quando ambos os contadores mostram 0, nada foi colocado em cache.

O processamento em lote reduz o custo para metade

A Batch API processa os pedidos de forma assíncrona, com um desconto de 50 por cento tanto na entrada como na saída. No exemplo acima, isso reduz 12.60 USD por 1.000 pedidos para 6.30 USD. O desconto acumula com o cache de prompts, pelo que um trabalho em lote com cache é a forma mais económica de executar processamento em massa.

A contrapartida é a latência. Por isso, o processamento em lote não é adequado para tarefas em que uma pessoa fica à espera do resultado. É adequado para classificações noturnas e para preencher documentos em falta.

Por que os custos do chat aumentam dentro de uma única conversa

Como a API não mantém estado, o seu cliente reenvia a conversa completa a cada turno. Por isso, o consumo de tokens num único chat cresce com o quadrado do seu comprimento, e não de forma linear.

Considere turnos com uma média de 500 tokens. O turno 1 envia 500 tokens de entrada. O turno 2 envia 1.000. O turno 20 envia 10.000. Aplicando a soma n(n+1)/2, uma conversa com 20 turnos terá enviado cerca de 105.000 tokens de entrada, embora a própria transcrição tenha apenas 10.000 tokens.

É por isso que uma funcionalidade de chat custa mais do que a sua transcrição sugere e que colocar em cache o prefixo estável ou resumir os turnos mais antigos compensa em conversas longas. Um agente que repete chamadas de ferramentas tem a mesma evolução, e o problema é maior: cada resultado de ferramenta permanece no histórico e é reenviado em todos os turnos seguintes. Definir um limite rígido de gastos para um agente que executa por sua conta é especialmente importante neste caso, porque esse crescimento é automático e ninguém o está a monitorizar.

Conte os tokens antes de fazer estimativas

Pare de calcular a quantidade de tokens a partir da contagem de palavras. A API faz essa contagem por si, sem custo, com um limite de taxa separado do limite de criação de mensagens.

curl https://api.anthropic.com/v1/messages/count_tokens \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "content-type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "system": "You are a scientist",
    "messages": [{
      "role": "user",
      "content": "Hello, Claude"
    }]
  }'

A resposta contém um campo:

{ "input_tokens": 14 }

Envie o seu prompt de sistema real e as definições das ferramentas, juntamente com uma mensagem de utilizador representativa, e introduza o número na função de custo acima. O endpoint aceita o mesmo corpo de um pedido de mensagem, pelo que também contabiliza corretamente imagens e PDFs. Há duas ressalvas importantes. A contagem é uma estimativa e pode diferir ligeiramente do valor faturado. Além disso, é medida com o tokenizador do modelo que indicar. Por isso, indique o modelo que vai realmente executar.

Não é possível contar os tokens de saída antecipadamente, porque ainda não existem. Limite-os com max_tokens e meça a distribuição real a partir de usage.output_tokens no tráfego de produção.

O que mais aparece na fatura

Os tokens representam a maior parte da fatura. Alguns itens não são tokens e surpreendem muitos utilizadores.

  • As definições das ferramentas tornam-se tokens de entrada em todos os pedidos. Só o prompt do sistema de utilização de ferramentas adiciona de 286 a 406 tokens no Opus 5, antes dos seus próprios esquemas. Dez descrições de ferramentas muito detalhadas podem duplicar um prompt pequeno.
  • A pesquisa na Web custa $10 por 1.000 pesquisas, além dos tokens consumidos pelos resultados quando entram no contexto.
  • A obtenção de conteúdo da Web não tem custo próprio, mas a página obtida torna-se tokens de entrada. Uma página de documentação de 100 kB corresponde aproximadamente a 25,000 desses tokens.
  • Pedir inferência exclusiva nos EUA com inference_geo no Claude 4.6 e versões posteriores aplica um multiplicador de 1.1 a todas as categorias de tokens, incluindo leituras e escritas da cache.

A decisão de comprar a API depende do seu volume de utilização. Abaixo de determinado nível de utilização, um plano mensal fixo é claramente mais vantajoso, e a comparação entre a API e uma subscrição Claude apresenta essa análise com números reais.

FAQ

Quanto custa 1M de tokens no Claude?

Depende do modelo e de os tokens serem de entrada ou de saída. Em agosto de 2026, um milhão de tokens de entrada custa $1 no Claude Haiku 4.5, $2 no Claude Sonnet 5 com o preço introdutório e $5 no Claude Opus 5. A saída custa cinco vezes a tarifa de entrada em cada um desses modelos. O Sonnet 5 passa a custar $3 por tokens de entrada e $15 por tokens de saída em 1 de setembro de 2026. As tarifas mudam. Confirme-as na página oficial de preços antes de incluir um valor num orçamento.

1M de tokens é o mesmo que 1M de palavras?

Não. Um token corresponde aproximadamente a 4 caracteres em inglês ou a cerca de 0,75 palavras. Portanto, um milhão de tokens corresponde a cerca de 750.000 palavras. Essa proporção serve apenas como orientação. Código, JSON e idiomas que não sejam inglês usam mais tokens por palavra. O Claude Opus 4.7 e versões posteriores também usam um tokenizador mais recente, que produz aproximadamente 30 por cento mais tokens para o mesmo texto do que o Claude Sonnet 4.6 e versões anteriores. Por isso, as contagens não são diretamente comparáveis entre gerações de modelos. Faça a medição com o endpoint gratuito /v1/messages/count_tokens, passando o modelo que pretende executar.

O cache de prompts reduz sempre os custos?

Não. Uma gravação numa cache de 5 minutos custa 1,25 vezes a tarifa base de entrada. Assim, um prefixo que é gravado e nunca é lido custa 25 por cento mais do que enviá-lo normalmente. O custo é compensado a partir da primeira leitura. O mecanismo pode falhar de duas formas, ambas sem indicação visível. Se o prefixo em cache mudar entre pedidos, a pesquisa nunca encontra correspondência, porque a correspondência exige um prefixo exato. Se o prefixo for menor do que o comprimento mínimo que o modelo permite colocar em cache, que é de 1,024 tokens no Sonnet 5 e 4,096 no Haiku 4.5, nada é colocado em cache e nenhum erro é devolvido. Quando cache_creation_input_tokens e cache_read_input_tokens mostram ambos 0, a cache não está a fazer nada.

Porque é que a minha fatura cresceu mais depressa do que o número de mensagens?

Porque toda a conversa é reenviada em cada turno. A Messages API não mantém estado. Por isso, o turno 20 de uma conversa inclui novamente como entrada todos os 19 turnos anteriores. Com turnos de 500 tokens em média, uma conversa de 20 turnos envia cerca de 105.000 tokens de entrada, embora a transcrição tenha apenas 10.000 tokens. Os ciclos de agentes funcionam da mesma forma, porque cada resultado de ferramenta permanece no histórico. Coloque o prefixo estável em cache ou resuma os turnos antigos e remova-os do pedido.