SSD Nodes Learn 8GB de RAM — $66/ano
Guias Matt ConnorPor Matt Connor · Atualizado 2026-08-02

Quanto custa 1 milhão de tokens no Claude?

Veja quanto custa 1M tokens no Claude: entrada e saída têm preços separados, e a saída custa cinco vezes mais que a entrada nos modelos atuais.

Quanto custam 1M tokens no Claude?

1M tokens significa um milhão de tokens. Essa é a unidade usada para expressar o preço de todas as APIs do Claude (application programming interface). Não existe um preço único, porque a entrada e a saída têm tarifas diferentes, e cada modelo tem seu próprio par de tarifas. Em agosto de 2026, um milhão de tokens de entrada custa $1 no Claude Haiku 4.5, $2 no Claude Sonnet 5 e $5 no Claude Opus 5.

A saída é a parte mais cara. Em todos os modelos atuais, a tarifa de saída é cinco vezes maior que a tarifa de entrada. Portanto, a proporção entre entrada e saída determina sua cobrança mais do que o valor de referência. Um aplicativo que envia documentos longos e retorna respostas curtas tem um comportamento de custo muito diferente de um aplicativo que gera respostas longas a partir de um prompt curto.

Esta página trata da economia por unidade: quanto custa um token e como estimar uma cobrança antes de criar seu aplicativo. Para saber onde os tokens são realmente usados durante o trabalho, leia onde os tokens são usados em uma sessão do Claude Code.

Como são 1M de tokens

Um token é um trecho de texto que o modelo lê ou escreve. A estimativa aproximada da Anthropic é de um token a cada 4 caracteres, ou cerca de 0.75 palavra em inglês. Portanto, 1 milhão de tokens corresponde a aproximadamente 750,000 palavras, ou cerca de 4 MB de texto simples.

As estimativas publicadas para entradas comuns dão uma noção melhor da escala.

ChartApproximate input token counts for common content, published estimates
The data behind this chart
[
  {
    "label": "Average web page (10 kB)",
    "tokens": "2,500"
  },
  {
    "label": "Documentation page (100 kB)",
    "tokens": "25,000"
  },
  {
    "label": "Research paper PDF (500 kB)",
    "tokens": "125,000"
  }
]

Nessas proporções, 1M de tokens corresponde a cerca de 400 páginas da web comuns lidas uma vez, ou a oito artigos de pesquisa desse tamanho. Isso equivale a uma passagem por uma base de código de tamanho médio, ou a um mês de uso moderado de chat por uma pessoa.

Considere tudo isso uma estimativa. Código, JSON e textos em idiomas diferentes do inglês contêm menos palavras por token, portanto a proporção de 0.75 representa o limite otimista. Há outro fator que altera a contagem: Claude Opus 4.7 e versões posteriores, incluindo Opus 5 e Sonnet 5, usam um tokenizer mais recente que produz aproximadamente 30 por cento mais tokens para o mesmo texto do que Sonnet 4.6 e versões anteriores. Claude Haiku 4.5 usa o tokenizer antigo. Portanto, uma contagem medida no Haiku 4.5 subestima a contagem no Sonnet 5 para uma entrada idêntica. Isso significa que uma comparação direta de preço por milhão entre essas versões não é justa. Conte o mesmo prompt nos dois modelos antes de decidir.

Quanto o Claude cobra por milhão de tokens

ChartClaude API list price in USD per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5
  },
  {
    "label": "Sonnet 5 (to 31 Aug 2026)",
    "input_usd": 2,
    "output_usd": 10
  },
  {
    "label": "Sonnet 5 (from 1 Sep 2026)",
    "input_usd": 3,
    "output_usd": 15
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25
  }
]

O Claude Sonnet 5 está com preços introdutórios de $2 para entrada e $10 para saída até 31 August 2026. A partir de 1 September 2026, aplica-se a tarifa padrão: $3 para entrada e $15 para saída. O Claude Opus 5 custa $5 para entrada e $25 para saída.

As tarifas mudam. Considere todos os valores desta página como um exemplo calculado em August 2026 e confirme os valores atuais na página oficial de preços antes de aprovar um orçamento.

O comprimento do contexto não altera a tarifa. No Claude 4.6 e em versões posteriores, a janela de contexto completa de 1M token é cobrada pela tarifa padrão. Portanto, uma solicitação de 900,000 tokens custa o mesmo por token que uma solicitação de 9,000 tokens. Um prompt longo custa mais porque contém mais tokens. Não há uma tarifa separada para contextos longos.

A aritmética que permanece após uma mudança de preço

Toda cobrança consiste em duas multiplicações e uma adição.

cost = (input_tokens  / 1,000,000) * input_rate
     + (output_tokens / 1,000,000) * output_rate

Escrito como código que você pode executar:

INPUT_RATE = 2.00    # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00  # USD per million output tokens

def cost(input_tokens, output_tokens):
    return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000

print(f"{cost(4300, 400):.4f}")

Isso imprime 0.0126. Uma solicitação que envia 4,300 tokens de entrada e recebe 400 tokens de saída custa cerca de 1.3 centavos no Sonnet 5. Mantenha as duas tarifas em um único lugar no código. Quando um preço mudar, edite duas linhas, e todas as estimativas do sistema serão atualizadas.

Uma estimativa prática para um aplicativo real

Considere um assistente de suporte. O prompt do sistema e a documentação do produto somam 4,000 tokens. Eles são enviados em todas as solicitações, porque a Messages API é sem estado e o modelo não mantém memória entre chamadas. A pergunta do usuário adiciona cerca de 300 tokens. Uma resposta tem cerca de 400 tokens. Isso resulta em 4,300 tokens de entrada e 400 tokens de saída por solicitação.

Um milhão de tokens de entrada permite cerca de 232 solicitações desse tipo. Com 1,000 solicitações por dia, o aplicativo consome 4.3 milhões de tokens de entrada diariamente. Portanto, "1M tokens" representa menos de seis horas de tráfego.

ChartEstimated cost per 1,000 requests at 4,300 input and 400 output tokens
The data behind this chart
[
  {
    "label": "Opus 5, list rates",
    "cost_per_1k_usd": "31.50"
  },
  {
    "label": "Sonnet 5, list rates",
    "cost_per_1k_usd": "12.60"
  },
  {
    "label": "Sonnet 5, Batch API",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Haiku 4.5, list rates",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Sonnet 5, warm prompt cache",
    "cost_per_1k_usd": "5.40"
  }
]

No Claude Opus 5, esse tráfego custa $31.50 por 1,000 solicitações. No Sonnet 5, custa $12.60. Usar Claude Haiku 4.5 reduz o custo para $6.30, e um cache de prompt aquecido no Sonnet 5 reduz ainda mais o custo, para $5.40.

Multiplique por 30 para obter o custo de um mês com esse tráfego. O Sonnet 5, pelas tarifas de tabela, custa cerca de $378 por mês. O mesmo aplicativo com um cache aquecido custa cerca de $162. A escolha do modelo e a decisão sobre o cache valem mais do que qualquer tarifa que você consiga negociar nesse volume. Qual modelo executar é uma questão separada. O modelo mais barato que passar pelas suas avaliações é o vencedor: como escolher entre Opus, Sonnet e Haiku explica como testar isso corretamente.

O cache de prompt reduz a parte repetida

Esse prefixo de 4,000 tokens é idêntico em todas as solicitações, mas você paga o preço total de entrada por ele a cada vez. O cache de prompt armazena o prefixo processado e cobra uma tarifa reduzida para reutilizá-lo.

Uma leitura do cache custa 0.1 vezes a tarifa básica de entrada. A gravação no cache custa 1.25 vezes a tarifa básica para a duração de 5 minutos, ou 2 vezes a tarifa básica para a duração de 1 hora. Portanto, o cache de 5 minutos se paga após uma leitura, porque a gravação custa 0.25 a mais, enquanto cada leitura economiza 0.9. O cache de 1 hora precisa de duas leituras para atingir o ponto de equilíbrio.

A maneira mais simples de ativá-lo é usar um único campo de nível superior:

curl https://api.anthropic.com/v1/messages \
  -H "content-type: application/json" \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "You are a helpful assistant.",
    "messages": [
      {"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
    ]
  }'

Em seguida, leia o bloco usage retornado:

{
  "usage": {
    "cache_creation_input_tokens": 5120,
    "cache_read_input_tokens": 1800,
    "input_tokens": 50,
    "output_tokens": 503
  }
}

Esses três contadores de entrada são cobrados com três tarifas diferentes e somam o volume real de entrada: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens. Uma estimativa de custo que lê somente input_tokens ficará muito incorreta quando o cache estiver ativado.

Duas condições impedem que um cache seja vantajoso, e ambas falham silenciosamente.

O prefixo precisa ser idêntico em nível de bytes. A consulta ao cache usa uma correspondência de prefixo. Portanto, um registro de data e hora ou o nome do usuário no início do prompt do sistema o altera em todas as solicitações. Nesse caso, você paga 1.25 vezes a tarifa básica de entrada a cada vez e nunca faz uma leitura. O sintoma é cache_creation_input_tokens permanecer alto enquanto cache_read_input_tokens permanece em 0. Coloque cache_control no último bloco cujo conteúdo seja igual entre as solicitações e coloque depois dele tudo o que variar. Alterar as definições de tools invalida todo o cache abaixo delas, porque a invalidação segue a ordem de tools, depois system e depois messages.

O prefixo precisa ser longo o suficiente. O tamanho mínimo que pode ser armazenado em cache é de 512 tokens no Opus 5, 1,024 no Sonnet 5 e 4,096 no Haiku 4.5. Um prompt menor não é armazenado em cache, e nenhum erro é retornado. O prefixo de 4,000 tokens do exemplo acima é armazenado em cache no Sonnet 5, mas não no Haiku 4.5, porque 4,000 está abaixo do limite mínimo desse modelo. Quando os dois contadores mostram 0, nada foi armazenado em cache.

O processamento em lote reduz a tarifa pela metade

A Batch API processa solicitações de forma assíncrona com desconto de 50 por cento tanto na entrada quanto na saída. No exemplo acima, isso reduz o custo de $12.60 por 1,000 solicitações para $6.30. O desconto é cumulativo com o armazenamento em cache de prompts. Por isso, uma tarefa em lote armazenada em cache é a opção mais barata para executar trabalhos em massa.

A desvantagem é a latência. Por isso, o processamento em lote não é adequado para tarefas nas quais uma pessoa precisa aguardar o resultado. Ele é adequado para classificações noturnas e preenchimento retroativo de documentos.

Por que os custos do chat aumentam dentro de uma conversa

Como a API não mantém estado, seu cliente reenvia a conversa inteira a cada turno. Portanto, o uso de tokens em um único chat cresce com o quadrado do seu tamanho, e não de forma linear.

Considere turnos com uma média de 500 tokens. O turno 1 envia 500 tokens de entrada. O turno 2 envia 1,000. O turno 20 envia 10,000. Aplicando a soma n(n+1)/2, uma conversa com 20 turnos terá enviado aproximadamente 105,000 tokens de entrada, embora a própria transcrição tenha apenas 10,000 tokens.

Por isso, um recurso de chat custa mais do que a transcrição sugere. Também é por isso que armazenar em cache o prefixo estável ou resumir turnos antigos compensa em conversas longas. Um agente que executa loops de chamadas de ferramentas tem o mesmo comportamento, e um custo ainda maior: cada resultado de ferramenta permanece no histórico e é reenviado em todos os turnos seguintes. Definir um limite rígido de gastos para um agente executado por você é mais importante nesse caso, porque esse crescimento é automático e ninguém o monitora.

Conte os tokens antes de fazer uma estimativa

Pare de derivar a contagem de tokens a partir da contagem de palavras. A API faz essa contagem para você, sem custo, em um limite de taxa separado da criação de mensagens.

curl https://api.anthropic.com/v1/messages/count_tokens \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "content-type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "system": "You are a scientist",
    "messages": [{
      "role": "user",
      "content": "Hello, Claude"
    }]
  }'

A resposta contém um campo:

{ "input_tokens": 14 }

Envie seu system prompt e as definições de ferramentas reais, junto com uma mensagem de usuário representativa, e insira o número na função de custo acima. O endpoint aceita o mesmo corpo de uma solicitação de mensagem, portanto imagens e PDFs também são contabilizados corretamente. Duas ressalvas são importantes. A contagem é uma estimativa e pode diferir ligeiramente do valor cobrado. Ela também é medida com o tokenizer do modelo informado, portanto informe o modelo que você realmente executará.

Não é possível contar os tokens de saída antecipadamente, porque eles ainda não existem. Limite-os com max_tokens e depois meça a distribuição real de usage.output_tokens no tráfego de produção.

O que mais entra na cobrança

Os tokens representam a maior parte da cobrança. Alguns itens não são tokens e surpreendem muitas pessoas.

  • As definições de ferramentas tornam-se tokens de entrada em cada solicitação. O system prompt de uso de ferramentas, sozinho, adiciona de 286 a 406 tokens no Opus 5, antes dos seus próprios esquemas. Dez descrições detalhadas de ferramentas podem dobrar um prompt pequeno.
  • A pesquisa na Web custa $10 por 1.000 pesquisas, além dos tokens consumidos pelos resultados quando eles entram no contexto.
  • A busca na Web não adiciona uma tarifa própria, mas a página obtida torna-se tokens de entrada. Uma página de documentação de 100 kB contém aproximadamente 25,000 tokens.
  • Solicitar inferência somente nos EUA com inference_geo no Claude 4.6 e versões posteriores aplica um multiplicador de 1.1 a cada categoria de tokens, incluindo leituras e gravações de cache.

A decisão de comprar a API depende também do seu volume de uso. Abaixo de determinado nível de uso, um plano mensal fixo é claramente mais vantajoso, e a comparação entre a API e uma assinatura do Claude apresenta essa análise com números reais.

FAQ

Quanto custa 1M de tokens no Claude?

Depende do modelo e de os tokens serem de entrada ou de saída. Em agosto de 2026, um milhão de tokens de entrada custa $1 no Claude Haiku 4.5, $2 no Claude Sonnet 5 com o preço introdutório e $5 no Claude Opus 5. A saída custa cinco vezes a tarifa de entrada em cada um desses modelos. O Sonnet 5 passará a custar $3 para entrada e $15 para saída em 1 September 2026. As tarifas mudam. Confirme os valores na página oficial de preços antes de incluir um valor no orçamento.

1M de tokens equivale a 1M de palavras?

Não. Um token corresponde aproximadamente a 4 caracteres em inglês, ou a cerca de 0,75 palavra. Portanto, um milhão de tokens equivale a aproximadamente 750.000 palavras. Essa proporção serve apenas como referência. Código, JSON e idiomas diferentes do inglês usam mais tokens por palavra. O Claude Opus 4.7 e versões posteriores também usam um tokenizador mais recente, que produz aproximadamente 30 por cento mais tokens para o mesmo texto do que o Claude Sonnet 4.6 e versões anteriores. Por isso, as contagens não são diretamente comparáveis entre gerações de modelos. Faça a medição usando o endpoint gratuito /v1/messages/count_tokens, informando o modelo que você pretende executar.

O cache de prompts sempre reduz os custos?

Não. Uma gravação no cache com duração de 5 minutos custa 1,25 vezes a tarifa básica de entrada. Portanto, um prefixo gravado e nunca lido custa 25 por cento mais do que enviá-lo sem cache. O custo se paga a partir da primeira leitura. O recurso falha de duas formas, ambas sem indicação. Se o prefixo armazenado em cache mudar entre as requisições, a consulta nunca encontrará correspondência, porque a comparação exige um prefixo exato. Se o prefixo for menor que o tamanho mínimo armazenável em cache do modelo, que é de 1,024 tokens no Sonnet 5 e 4,096 no Haiku 4.5, nada será armazenado e nenhum erro será retornado. Quando cache_creation_input_tokens e cache_read_input_tokens exibirem 0, o cache não está fazendo nada.

Por que minha fatura aumentou mais rápido que a quantidade de mensagens?

Porque toda a conversa é reenviada a cada turno. A Messages API não mantém estado. Por isso, o turno 20 de uma conversa inclui novamente, como entrada, todos os 19 turnos anteriores. Com uma média de 500 tokens por turno, uma conversa de 20 turnos envia aproximadamente 105.000 tokens de entrada, embora a transcrição tenha apenas 10.000 tokens. Loops de agentes funcionam da mesma forma, porque cada resultado de ferramenta permanece no histórico. Armazene o prefixo estável em cache ou resuma os turnos antigos e remova-os da requisição.

#claude#tokens#api-pricing#cost-estimation#prompt-caching