SSD Nodes Learn Hosting plans →
Guias Matt ConnorPor Matt Connor · Atualizado 2026-08-24

Quanto custa 1M de tokens no Claude?

Veja quanto custa 1M de tokens no Claude: entrada e saída têm preços separados, e a saída custa 5 vezes mais em todos os modelos atuais.

Quanto custa 1M de tokens no Claude?

1M de tokens significa um milhão de tokens. Esta é a unidade usada para apresentar os preços de todas as API (application programming interface) do Claude. Não existe um preço único, porque os tokens de entrada e de saída são cobrados a taxas diferentes e cada modelo tem o seu próprio par de preços. Em agosto de 2026, um milhão de tokens de entrada custa $1 no Claude Haiku 4.5, $2 no Claude Sonnet 5 e $5 no Claude Opus 5.

A saída é a parte mais cara. Em todos os modelos atuais, a taxa de saída é cinco vezes superior à taxa de entrada. Por isso, a proporção entre as duas determina a sua fatura mais do que o valor de referência. Uma aplicação que envia documentos longos e devolve respostas curtas tem um comportamento de custos muito diferente de uma aplicação que escreve respostas longas a partir de um prompt curto.

Esta página aborda a economia unitária: quanto custa um token e como estimar uma fatura antes de criar a aplicação. Para saber onde os tokens são efetivamente usados durante o trabalho, leia onde os tokens são usados numa sessão do Claude Code.

Como são 1M de tokens

Um token é um fragmento de texto que o modelo lê ou escreve. A orientação aproximada da Anthropic é um token por cada 4 caracteres, ou cerca de 0.75 palavras em inglês. Portanto, um milhão de tokens corresponde a cerca de 750,000 palavras, ou aproximadamente 4 MB de texto simples.

As estimativas publicadas para entradas comuns ajudam a ter uma noção melhor da escala.

ChartApproximate input token counts for common content, published estimates
The data behind this chart
[
  {
    "label": "Average web page (10 kB)",
    "tokens": "2,500"
  },
  {
    "label": "Documentation page (100 kB)",
    "tokens": "25,000"
  },
  {
    "label": "Research paper PDF (500 kB)",
    "tokens": "125,000"
  }
]

Com essas proporções, 1M de tokens corresponde aproximadamente a 400 páginas Web médias lidas uma vez, ou a oito artigos de investigação desse tamanho. Equivale a uma passagem por uma base de código de tamanho médio ou a um mês de utilização ligeira de chat por uma pessoa.

Considere tudo isto uma estimativa. Código, JSON e texto em idiomas diferentes do inglês contêm menos palavras por token, pelo que a proporção de 0.75 representa o limite otimista. Há outro fator que altera a contagem: Claude Opus 4.7 e versões posteriores, incluindo Opus 5 e Sonnet 5, usam um tokenizador mais recente que produz aproximadamente 30 por cento mais tokens para o mesmo texto do que Sonnet 4.6 e versões anteriores. Claude Haiku 4.5 usa o tokenizador antigo. Assim, uma contagem medida no Haiku 4.5 subestima a contagem no Sonnet 5 para uma entrada idêntica. Por isso, uma comparação direta do preço por milhão entre essas versões não é justa. Conte o mesmo prompt em ambos os modelos antes de decidir.

O que o Claude cobra por milhão de tokens

ChartClaude API list price in USD per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5
  },
  {
    "label": "Sonnet 5 (to 31 Aug 2026)",
    "input_usd": 2,
    "output_usd": 10
  },
  {
    "label": "Sonnet 5 (from 1 Sep 2026)",
    "input_usd": 3,
    "output_usd": 15
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25
  }
]

O Claude Sonnet 5 tem preços promocionais de lançamento de $2 por tokens de entrada e $10 por tokens de saída até 31 August 2026. A partir de 1 September 2026, aplica-se a tarifa padrão: $3 por tokens de entrada e $15 por tokens de saída. O Claude Opus 5 custa $5 por tokens de entrada e $25 por tokens de saída. Um modelo fica acima de toda essa tabela: o Claude Fable 5 custa $10 por tokens de entrada e $50 por tokens de saída. Por isso, saber se essas tarifas compensam depende das tarefas a que realmente o vai destinar.

As tarifas mudam. Considere todos os valores desta página como um exemplo calculado em August 2026 e confirme os números atuais na página oficial de preços antes de aprovar um orçamento.

Estas tarifas indicam quanto custa o Claude, mas não se ele é a opção mais barata para a sua carga de trabalho. Três tarefas com custos calculados no Claude e no ChatGPT mostram qual API oferece o menor custo em cada caso.

O comprimento do contexto não altera a tarifa. No Claude 4.6 e posteriores, a janela de contexto completa de 1M tokens é faturada com os preços padrão. Por isso, um pedido de 900,000 tokens custa o mesmo por token que um pedido de 9,000 tokens. Um prompt longo custa mais porque contém mais tokens. Não se aplica uma tarifa separada para contextos longos.

A aritmética que continua correta após uma alteração de preço

Cada fatura é composta por duas multiplicações e uma adição.

cost = (input_tokens  / 1,000,000) * input_rate
     + (output_tokens / 1,000,000) * output_rate

Escrito como código que pode executar:

INPUT_RATE = 2.00    # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00  # USD per million output tokens

def cost(input_tokens, output_tokens):
    return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000

print(f"{cost(4300, 400):.4f}")

Isto imprime 0.0126. Um pedido que envia 4,300 tokens de entrada e recebe 400 tokens de saída custa cerca de 1,3 cêntimos no Sonnet 5. Mantenha as duas tarifas num único local do código. Quando um preço muda, edita duas linhas e todas as estimativas do sistema são atualizadas.

Uma estimativa calculada para uma aplicação real

Considere um assistente de suporte. O prompt do sistema e a documentação do produto somam 4,000 tokens e são enviados em todos os pedidos, porque a Messages API não mantém estado e o modelo não conserva qualquer informação entre chamadas. A pergunta do utilizador acrescenta cerca de 300 tokens. A resposta tem cerca de 400. Isso corresponde a 4,300 tokens de entrada e 400 de saída por pedido.

Um milhão de tokens de entrada compra cerca de 232 pedidos com esse formato. Com 1,000 pedidos por dia, a aplicação consome 4.3 milhões de tokens de entrada diariamente. Portanto, "1M tokens" representa menos de seis horas de tráfego.

ChartEstimated cost per 1,000 requests at 4,300 input and 400 output tokens
The data behind this chart
[
  {
    "label": "Opus 5, list rates",
    "cost_per_1k_usd": "31.50"
  },
  {
    "label": "Sonnet 5, list rates",
    "cost_per_1k_usd": "12.60"
  },
  {
    "label": "Sonnet 5, Batch API",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Haiku 4.5, list rates",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Sonnet 5, warm prompt cache",
    "cost_per_1k_usd": "5.40"
  }
]

No Claude Opus 5, esse tráfego custa $31.50 por 1,000 pedidos. No Sonnet 5, custa $12.60. Ao mudar para Claude Haiku 4.5, o custo baixa para $6.30, e uma cache de prompts ativa no Sonnet 5 reduz o custo ainda mais, para $5.40.

Multiplique por 30 para obter o custo de um mês com esse tráfego. O Sonnet 5, com as tarifas públicas, custa cerca de $378 por mês. A mesma aplicação com uma cache ativa custa cerca de $162. A escolha do modelo e a decisão de usar cache valem, cada uma, mais do que qualquer tarifa que consiga negociar com este volume. A escolha do modelo é uma questão própria, e vence o modelo mais barato que passe pelas suas avaliações: como escolher entre Opus, Sonnet e Haiku explica como testar isso corretamente.

O cache de prompts reduz o custo da parte repetida

Esse prefixo de 4,000 tokens é idêntico em todas as solicitações, mas paga o preço total de entrada por ele todas as vezes. O cache de prompts armazena o prefixo processado e aplica uma tarifa reduzida quando ele é reutilizado.

Uma leitura do cache custa 0.1 vezes a tarifa de entrada base. A gravação no cache custa 1.25 vezes a tarifa base para a validade de 5 minutos ou 2 vezes a tarifa base para a validade de 1 hora. Portanto, o cache de 5 minutos compensa depois de uma leitura, porque a gravação custa 0.25 adicional, enquanto cada leitura poupa 0.9. O cache de 1 hora precisa de duas leituras para atingir o ponto de equilíbrio.

A forma mais simples de ativá-lo é usar um único campo de nível superior:

curl https://api.anthropic.com/v1/messages \
  -H "content-type: application/json" \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "You are a helpful assistant.",
    "messages": [
      {"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
    ]
  }'

Em seguida, leia o bloco usage devolvido:

{
  "usage": {
    "cache_creation_input_tokens": 5120,
    "cache_read_input_tokens": 1800,
    "input_tokens": 50,
    "output_tokens": 503
  }
}

Esses três contadores de entrada são faturados a tarifas diferentes e somam o volume real de entrada: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens. Uma estimativa de custo que leia apenas input_tokens ficará muito errada quando o cache estiver ativo.

Duas situações impedem que o cache compense, e ambas falham silenciosamente.

O prefixo deve ser idêntico ao nível dos bytes. A pesquisa do cache verifica correspondências de prefixo. Portanto, um carimbo de data e hora ou o nome do utilizador no início do prompt do sistema altera o prefixo em todas as solicitações. Nesse caso, paga 1.25 vezes a tarifa de entrada base todas as vezes e nunca faz uma leitura. O sintoma é cache_creation_input_tokens permanecer alto enquanto cache_read_input_tokens permanece em 0. Coloque cache_control no último bloco cujo conteúdo é igual entre as solicitações e coloque depois dele tudo o que varia. Alterar as definições de tools invalida todo o cache abaixo delas, porque a invalidação percorre a ordem tools, depois system e depois messages.

O prefixo deve ser suficientemente longo. O comprimento mínimo que pode ser colocado em cache é de 512 tokens no Opus 5, 1,024 no Sonnet 5 e 4,096 no Haiku 4.5. Um prompt mais curto não é colocado em cache e nenhum erro é devolvido. O prefixo de 4,000 tokens do exemplo acima é colocado em cache no Sonnet 5, mas não no Haiku 4.5, porque 4,000 fica abaixo do limite mínimo desse modelo. Quando ambos os contadores mostram 0, nada foi colocado em cache.

O processamento em lote reduz a taxa para metade

A Batch API processa pedidos de forma assíncrona, com um desconto de 50 por cento tanto na entrada como na saída. No exemplo anterior, isso reduz 12.60 USD por 1.000 pedidos para 6.30 USD. O desconto acumula com o armazenamento em cache de prompts, pelo que uma tarefa em lote com cache é a forma mais económica de executar trabalho em grande escala.

A contrapartida é a latência. Por isso, o processamento em lote não é adequado para tarefas em que uma pessoa fica à espera do resultado. É adequado para classificações executadas durante a noite e para preencher documentos em falta.

Por que os custos do chat crescem dentro de uma única conversa

Como a API não mantém estado, o seu cliente reenvia a conversa completa a cada turno. Por isso, o uso de tokens num único chat cresce com o quadrado do seu comprimento, e não de forma linear.

Considere turnos com uma média de 500 tokens. O turno 1 envia 500 tokens de entrada. O turno 2 envia 1,000. O turno 20 envia 10,000. A soma é n(n+1)/2, portanto uma conversa com 20 turnos enviou cerca de 105,000 tokens de entrada, embora a própria transcrição tenha apenas 10,000 tokens.

É por isso que uma funcionalidade de chat custa mais do que a transcrição indica, e que colocar em cache o prefixo estável ou resumir turnos antigos compensa em conversas longas. Um agente que percorre chamadas de ferramentas tem a mesma estrutura, e o problema é ainda maior: cada resultado de ferramenta permanece no histórico e é reenviado em todos os turnos seguintes. Definir um limite rígido de gastos para um agente que executa por sua conta é especialmente importante neste caso, porque esse crescimento é automático e ninguém o está a monitorizar.

Conte os tokens antes de estimar

Pare de derivar a contagem de tokens a partir da contagem de palavras. A API faz essa contagem sem custos, com um limite de taxa separado da criação de mensagens.

curl https://api.anthropic.com/v1/messages/count_tokens \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "content-type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "system": "You are a scientist",
    "messages": [{
      "role": "user",
      "content": "Hello, Claude"
    }]
  }'

A resposta contém um campo:

{ "input_tokens": 14 }

Envie o seu prompt de sistema real e as definições das ferramentas, juntamente com uma mensagem de utilizador representativa, e introduza o número na função de custo acima. O endpoint aceita o mesmo corpo que um pedido de mensagem, por isso as imagens e os PDFs também são contabilizados corretamente. Há duas ressalvas importantes. A contagem é uma estimativa e pode diferir ligeiramente do valor faturado. Também é calculada com o tokenizador do modelo indicado, por isso indique o modelo que pretende realmente executar.

Não é possível contar antecipadamente os tokens de saída, porque ainda não existem. Limite-os com max_tokens e, depois, meça a distribuição real a partir de usage.output_tokens no tráfego de produção.

O que mais entra na fatura

Os tokens representam a maior parte da fatura. Alguns itens não são tokens e podem surpreender.

  • As definições de ferramentas tornam-se tokens de entrada em todos os pedidos. O prompt de sistema de uso de ferramentas, por si só, acrescenta 286 a 406 tokens no Opus 5, antes dos seus próprios esquemas. Dez descrições de ferramentas detalhadas podem duplicar um prompt pequeno.
  • A pesquisa na Web custa $10 por 1.000 pesquisas, além dos tokens consumidos pelos resultados quando estes entram no contexto.
  • A obtenção de páginas Web não tem um custo próprio, mas a página obtida transforma-se em tokens de entrada. Uma página de documentação com 100 kB corresponde aproximadamente a 25,000 desses tokens.
  • Pedir inferência exclusivamente nos EUA com inference_geo no Claude 4.6 e posteriores aplica um multiplicador de 1.1 a todas as categorias de tokens, incluindo leituras e escritas da cache.

A decisão de comprar a API depende sobretudo do seu volume de utilização. Normalmente, esta questão surge quando um plano atinge o limite de utilização, e as opções para ultrapassar um limite vão desde esperar que a janela seja reposta até transferir esse trabalho para chamadas de API com cobrança por utilização. Abaixo de determinado nível de utilização, um plano mensal fixo é claramente mais vantajoso, e a API comparada com uma subscrição Claude faz essa comparação com números reais.

FAQ

Quanto custam 1M tokens no Claude?

Depende do modelo e de os tokens serem de entrada ou de saída. Em agosto de 2026, um milhão de tokens de entrada custa $1 no Claude Haiku 4.5, $2 no Claude Sonnet 5 com o preço promocional inicial e $5 no Claude Opus 5. A saída custa cinco vezes a tarifa de entrada em cada um desses modelos. O Sonnet 5 passa a custar $3 por tokens de entrada e $15 por tokens de saída em 1 setembro 2026. As tarifas mudam, por isso confirme-as na página oficial de preços antes de incluir um valor num orçamento.

1M tokens é o mesmo que 1M palavras?

Não. Um token corresponde aproximadamente a 4 caracteres em inglês, ou a cerca de 0,75 palavras. Assim, um milhão de tokens corresponde a aproximadamente 750.000 palavras. Essa proporção serve apenas como referência. Código, JSON e idiomas diferentes do inglês usam mais tokens por palavra. O Claude Opus 4.7 e versões posteriores também usam um tokenizador mais recente, que produz aproximadamente 30 por cento mais tokens para texto idêntico do que o Claude Sonnet 4.6 e versões anteriores. Por isso, as contagens não são diretamente comparáveis entre gerações de modelos. Faça a medição com o endpoint gratuito /v1/messages/count_tokens, passando o modelo que pretende executar.

O prompt caching reduz sempre os custos?

Não. A gravação de uma cache de 5 minutos custa 1,25 vezes a tarifa base de entrada. Assim, um prefixo gravado e nunca lido custa 25 por cento mais do que enviá-lo normalmente. A cache compensa o custo a partir da primeira leitura. Pode falhar de duas formas, ambas silenciosas. Se o prefixo em cache mudar entre pedidos, a consulta nunca corresponde, porque a correspondência exige um prefixo exato. Se o prefixo for menor do que o comprimento mínimo que o modelo permite colocar em cache — 1.024 tokens no Sonnet 5 e 4.096 no Haiku 4.5 — nada é colocado em cache e nenhum erro é devolvido. Quando cache_creation_input_tokens e cache_read_input_tokens apresentam ambos o valor 0, a cache não está a fazer nada.

Porque é que a minha fatura cresceu mais depressa do que o número de mensagens?

Porque toda a conversa é reenviada a cada turno. A Messages API não mantém estado, por isso o turno 20 de uma conversa inclui novamente como entrada todos os 19 turnos anteriores. Com turnos de 500 tokens em média, uma conversa de 20 turnos envia cerca de 105.000 tokens de entrada, embora a transcrição tenha apenas 10.000 tokens. Os ciclos de agentes funcionam da mesma forma, porque cada resultado de ferramenta permanece no histórico. Coloque o prefixo estável em cache ou resuma os turnos mais antigos e remova-os do pedido.