SSD Nodes Learn
Guias Matt ConnorPor Matt Connor · Atualizado 2026-07-24

Claude API vs Assinatura: qual é mais barato?

Compare o custo por token da Claude API com o valor fixo da assinatura. Veja o cálculo de break-even para decidir entre faturamento por uso ou plano mensal.

O Claude API é mais barato que uma assinatura?

O Claude API é mais barato que uma assinatura abaixo de um certo volume de uso, e mais caro acima dele. Para um desenvolvedor que coda interativamente o dia todo, o plano fixo geralmente vence. Para um programa que faz suas próprias chamadas, a API é a única opção, então o custo não é o fator decisivo. O restante é aritmética que você pode fazer em dez minutos.

Não existe um número oficial de break-even para consulta. O lado da assinatura é vendido por janelas de uso em vez de limites de tokens, então nenhum valor publicado pode dizer onde as duas linhas se cruzam. O que segue é a fórmula, precificada com base nas taxas atuais por token, somada às partes do seu próprio comportamento que movem o resultado muito mais do que a taxa do plano. Cada valor de break-even abaixo é minha própria aritmética baseada em taxas publicadas e suposições declaradas, não um número documentado.

Se você ainda está decidindo qual plano comprar, qual plano do Claude se ajusta ao seu modo de trabalho responde isso. Este post assume que você já sabe qual plano compraria e quer saber se deve comprá-lo ou não.

Dois modelos de faturamento que não possuem a mesma estrutura

Uma assinatura é capacidade que você pode não usar. Você paga uma taxa fixa e recebe uma cota que reseta em um cronograma. A documentação do Claude Code da Anthropic descreve o formato para assentos Team e Enterprise: o uso "consome de uma cota por assento que reseta em uma janela rotativa de cinco horas e uma janela semanal", compartilhada com o Claude chat e Cowork. Um assinante encontra o mesmo limite através das mensagens que recebe, que dizem "You've hit your session limit" e "You've hit your weekly limit". Capacidade não utilizada é dinheiro gasto sem necessidade. Capacidade excedida interrompe seu trabalho até que a janela resete, e trocar de modelo com /model não restaura o acesso, pois as janelas são compartilhadas entre os modelos.

A API é um medidor que nunca para. Não há janela nem barreira. Cada requisição é precificada por token, e algumas coisas são precificadas fora dos tokens: a busca web "está disponível na Claude API por $10 por 1.000 buscas". Nada para em um limite. A fatura simplesmente cresce.

Taxas de planos em 23 de julho de 2026, citadas da página de preços do Claude: Pro é "$17 por mês com desconto de assinatura anual ($200 faturados antecipadamente). $20 se faturado mensalmente", e inclui o Claude Code. Max é listado como "A partir de $100 por mês". Assentos Team começam em "$20 por assento / mês se faturado anualmente". Enterprise é o caso interessante, pois executa ambos os modelos simultaneamente: "Preço do assento + uso nas taxas da API $20/assento". As taxas mudam com frequência, e a cota por trás de cada uma nunca é publicada em tokens, portanto, leia a página de preços no dia em que decidir.

O que você não consegue obter da API

Uma cota de plano e a interface construída em torno dela. O comando /usage-credits do Claude Code gerencia créditos de uso da assinatura, e você o executa "após fazer login com sua assinatura claude.ai através de /login; o comando não está disponível com autenticação por chave de API". A tela /usage também difere conforme o modo de faturamento: seu bloco Session "mostra o uso de tokens da API e é destinado a usuários de API", enquanto assinantes veem barras de uso do plano e um detalhamento de uso em vez disso.

Um cache de prompt mais longo no Claude Code. Este item custa dinheiro real e é fácil de ignorar. A documentação diz: "A vida útil é de uma hora em uma assinatura e cai para cinco minutos assim que você estiver usando créditos de uso; em uma chave de API ou provedor de nuvem, são cinco minutos por padrão". Sua primeira mensagem após uma pausa maior que o tempo de vida do cache perde o cache, então todo o seu contexto é reprocessado e cobrado com preços de escrita. Em uma assinatura, você pode fazer uma reunião de cinquenta minutos e voltar com o cache ativo. Em uma chave de API, a mesma pausa custa uma reescrita completa do prefixo da sessão.

O que você não consegue obter de uma assinatura

Acesso programático. Um cron job ou um handler de webhook que chama o Claude precisa de uma chave de API, então, se essa for sua carga de trabalho, a comparação termina aqui. Construindo seu primeiro app Claude API em um VPS cobre o manuseio de chaves e o primeiro script funcional.

O desconto da Batch API. A página de preços declara claramente: "A Batch API permite o processamento assíncrono de grandes volumes de requisições com um desconto de 50% tanto em tokens de entrada quanto de saída." Isso reduz pela metade o medidor para qualquer trabalho que não dependa de espera humana. As taxas de Batch por milhão de tokens são $2.50 para entrada e $12.50 para saída no Opus 4.8, $1 e $5 no Sonnet 5 em preço introdutório, e $0.50 e $2.50 no Haiku 4.5. A troca é a latência: a maioria dos batches termina em uma hora, um batch que não for concluído em 24 horas expira, e o streaming não pode ser processado em batch. Batch e prompt caching funcionam de forma cumulativa e, como um batch pode rodar por mais de cinco minutos, use o cache de 1 hora dentro de um.

Atribuição de custo por projeto. Cada resposta da API retorna um bloco usage, permitindo logar o custo de uma única requisição e atribuí-lo a um projeto ou cliente. Uma assinatura reporta um único conjunto de barras para a pessoa que detém o assento.

Considere um ponto com cuidado, pois é fácil assumir o contrário: estas são superfícies de faturamento distintas. A documentação da Anthropic direciona o faturamento da assinatura para o suporte do claude.ai e o faturamento do Console para a plataforma de API, e /usage-credits não funciona sob uma chave de API. Nada que eu verifiquei indica que uma assinatura inclua crédito de API, então planeje duas contas e duas faturas.

A fórmula de break-even

Calcule o preço de uma interação, depois escale.

turn cost = uncached_input_tokens x base_input_price
          + cache_write_tokens    x 1.25 x base_input_price
          + cache_read_tokens     x 0.10 x base_input_price
          + output_tokens         x output_price

monthly API cost = turn cost x turns_per_active_day x active_days_per_month

break even when: monthly API cost = flat plan fee

Os multiplicadores são publicados, não estimados. Um write de cache de 5 minutos custa "1.25x o preço base de entrada", um write de 1 hora custa "2x o preço base de entrada", e um read de cache custa "0.1x o preço base de entrada". Tokens de pensamento (thinking) são faturados como tokens de saída, portanto, pertencem ao output_tokens mesmo em modelos que não exibem um resumo de raciocínio.

Taxas base por milhão de tokens (MTok), atuais em 23 de julho de 2026:

  • claude-fable-5: $10 entrada, $50 saída. Cache read $1. 5-min cache write $12.50. 1M context.
  • claude-opus-4-8 e claude-opus-4-7: $5 entrada, $25 saída. Cache read $0.50. 5-min cache write $6.25. 1M context.
  • claude-sonnet-5: $2 entrada, $10 saída em preço introdutório até 31 de agosto de 2026, depois $3 e $15. Em taxas introdutórias, cache read $0.20 e 5-min cache write $2.50. 1M context.
  • claude-haiku-4-5: $1 entrada, $5 saída. Cache read $0.10. 5-min cache write $1.25. 200K context.

Não há sobretaxa para contexto longo: "Uma requisição de 900k-tokens é faturada na mesma taxa por token que uma requisição de 9k-tokens."

Um exemplo prático, com as suposições detalhadas

Considere uma interação média do Claude Code no Sonnet 5 carregando 60.000 tokens de contexto: 55.000 servidos do cache, 3.000 escritos no cache, 2.000 tokens de entrada nova sem cache, e 1.200 tokens de saída incluindo thinking.

  • Cache reads: 55,000 x $0.20/MTok = $0.0110
  • Cache writes: 3,000 x $2.50/MTok = $0.0075
  • Uncached input: 2,000 x $2.00/MTok = $0.0040
  • Output: 1,200 x $10.00/MTok = $0.0120

Isso resulta em cerca de $0.035 por interação. Com 120 interações em um dia ativo, aproximadamente $4.14 por dia. Com 20 dias ativos por mês, aproximadamente $83 por mês.

Compare isso com as taxas fixas acima e o resultado diz duas coisas simultaneamente. É cerca de quatro vezes a taxa Pro, então o Pro é mais barato no papel, desde que sua cota suporte 120 interações do Sonnet por dia. Essa ressalva é o que nenhum número publicado pode resolver para você. O mesmo valor de $83 fica abaixo da taxa inicial do Max, então aqui o medidor vence o Max.

Agora mude uma suposição por vez e observe a taxa do plano deixar de ser o número decisivo.

Três coisas que movem o break-even mais do que o preço do plano

Prompt caching. Execute a mesma interação de 60.000 tokens sem cache e todo o prompt será faturado como entrada nova: 60,000 x $2.00/MTok = $0.12, mais $0.012 de saída, totalizando $0.132 por interação. Isso é quase quatro vezes o valor da interação com cache, e transforma o mês de $83 em cerca de $317. Este é o único break-even que a Anthropic publica, pois não depende da sua carga de trabalho: "Um cache hit custa 10% do preço padrão de entrada, o que significa que o cache compensa após apenas um cache read para a duração de 5 minutos (1.25x write), ou após dois cache reads para a duração de 1 hora (2x write)."

Dois modos de falha desativam o cache sem aviso. O primeiro é um prefixo menor que o comprimento mínimo cacheável do modelo: 512 tokens no Fable 5, 1.024 no Opus 4.8 e Sonnet 5, 2.048 no Opus 4.7, e 4.096 no Haiku 4.5. Um prefixo curto não faz cache e nenhum erro é gerado. O segundo são requisições paralelas, pois "uma entrada de cache só fica disponível após o início da primeira resposta". Dez requisições idênticas disparadas simultaneamente pagam o preço total de entrada. O sinal de ambos é o cache_read_input_tokens parado em zero.

Escolha do modelo. Calcule a mesma interação no Opus 4.8, a $5 de entrada e $25 de saída, com cache reads a $0.50 e 5-min writes a $6.25 por MTok: reads $0.0275, writes $0.0188, uncached input $0.0100, output $0.0300. Isso resulta em cerca de $0.086 por interação, 2.5 vezes a interação do Sonnet, e cerca de $207 por mês no mesmo volume. Uma escolha de modelo moveu o mesmo trabalho de abaixo da taxa inicial do Max para mais do que o dobro dela. O Haiku 4.5 a $1 e $5 move o resultado para o outro lado para tarefas mecânicas como triagem de logs.

O nível de esforço pertence à escolha do modelo, pois tokens de pensamento são faturados com taxas de saída. No Opus 4.8, o padrão da API é high, e o ponto de partida documentado para codificação e trabalho de agentes é o mais caro, xhigh. Reduza isso com /effort no Claude Code ou com output_config.effort na API. Mais um detalhe altera as estimativas antigas: os modelos mais novos usam um tokenizer mais novo que "produz aproximadamente 30% mais tokens para o mesmo texto", então uma contagem medida em um modelo antigo subestima o mesmo texto hoje.

Higiene de sessão. A API é stateless, então cada interação reenvia toda a conversa como entrada faturada. Uma sessão longa, portanto, custa mais por mensagem do que uma nova, que é o mecanismo por trás da maioria das faturas surpresa e é detalhado em o que realmente consome tokens em uma sessão do Claude Code. Execute /clear entre tarefas não relacionadas, pois o contexto obsoleto é reenviado e refaturado em cada mensagem posterior. Execute /compact dentro de uma única tarefa longa, para que o histórico seja resumido em vez de carregado por completo. Trabalhe em períodos contínuos, pois o cache padrão "tem uma vida útil de 5 minutos" e "é atualizado sem custo adicional cada vez que o conteúdo em cache é usado". Uma sessão que você toca uma vez a cada dez minutos paga uma reescrita a cada vez. Uma sessão do Claude Code rodando em tmux em um VPS isolada gasta quase nada enquanto está ociosa, mas ficar ocioso além do tempo de vida do cache ainda faz você perder o prefixo aquecido.

Meça seu próprio uso antes de decidir

Não decida com base no meu exemplo. Decida com base em uma semana sua.

No Claude Code, execute /usage ao final de cada sessão por uma semana (/cost é um alias para a mesma tela). Ele reporta a contagem de tokens da sessão e uma estimativa de custo, com uma ressalva da documentação: "O valor em dólares é uma estimativa calculada localmente a partir da contagem de tokens e pode diferir da sua fatura real." Os totais resetam quando você executa /clear, então leia a tela primeiro. Em uma assinatura, esse valor em dólares não é sua fatura, mas a contagem de tokens por trás dele é o que esta fórmula precisa. /context mostra o que está preenchendo a janela.

Em uma conta de API, a página de uso no Claude Console é o registro oficial. Para precificar um prompt antes de enviá-lo, client.messages.count_tokens() é "gratuito para uso, mas sujeito a limites de taxa de requisições por minuto baseados no seu nível de uso", e é a única contagem que utiliza o tokenizer pelo qual você será realmente faturado.

Após uma chamada, leia o bloco de uso, e leia-o corretamente:

u = response.usage
total_input = u.input_tokens + u.cache_creation_input_tokens + u.cache_read_input_tokens

input_tokens conta apenas o restante sem cache, documentado como "tokens após o último breakpoint de cache". Uma interação reportando input_tokens: 4000 não é uma interação de 4.000 tokens, e os três campos somados são o tamanho do prompt que esta fórmula requer.

Então compare. Se o seu mês medido ficar claramente abaixo da taxa do plano, use o medidor. Se ficar claramente acima, use o plano, desde que sua cota suporte um dia de trabalho normal. Se ficar perto da linha, use o plano, porque um plano não pode surpreender você, mas um medidor pode.

FAQ

O Claude API é mais barato que o Claude Pro ou Max?

Depende do volume, e não existe um break-even publicado para consulta, porque as assinaturas são vendidas por janelas de uso em vez de limites de tokens. Calcule o preço de uma interação típica com base nas taxas publicadas por token, multiplique pelas suas interações por dia ativo e dias ativos por mês, e então compare esse valor com a taxa do plano. Em um exemplo prático, uma interação de 60.000 tokens no Sonnet 5 custou cerca de $0.035, ou aproximadamente $83 por mês com 120 interações por dia durante 20 dias: acima da taxa Pro, abaixo da taxa inicial do Max.

Como eu calculo meu custo mensal do Claude API?

Execute /usage no Claude Code por uma semana para coletar contagens reais de tokens, ou leia a página de uso no Claude Console se você já possui uma conta de API. Então, precifique uma interação: entrada sem cache na taxa base, writes de cache a 1.25 vezes a taxa de entrada base, reads de cache a 0.1 vezes a taxa de entrada base, e saída na taxa de saída, contando tokens de pensamento como saída. Multiplique pelas interações por dia ativo e dias ativos por mês.

O que mais altera uma fatura do Claude API?

O prompt caching, mais do que qualquer outra coisa. Uma interação de 60.000 tokens no Sonnet 5 custa cerca de $0.035 quando o prefixo é servido do cache e cerca de $0.132 quando não é. A escolha do modelo vem a seguir: a mesma interação no Opus 4.8 custa cerca de $0.086. O comprimento da sessão vem em terceiro lugar, pois a API é stateless e cada interação reenvia toda a conversa como entrada faturada.

Uma assinatura do Claude inclui acesso à API?

Trate-as como duas contas com duas faturas. Chamadas de API são faturadas por token contra uma conta que você cria no Console, e nada na documentação que eu verifiquei indica que uma assinatura concede crédito de API. O sinal mais claro de que são superfícies distintas é o comando /usage-credits do Claude Code, que "não está disponível com autenticação por chave de API". Muitos desenvolvedores possuem ambos: um plano para codificação interativa e uma chave para as coisas que constroem.