Quantos tokens o Claude Pro inclui?
O Claude Pro nao publica uma franquia de tokens: o limite usa mensagens em janela continua. Veja como conversas longas consomem mais e onde consultar o seu limite.
Quantos tokens o Claude Pro inclui?
O Claude Pro não inclui uma franquia de tokens e, em setembro de 2026, a Anthropic não publica nenhuma. Uma subscrição do Claude é medida em mensagens dentro de uma janela de tempo contínua, não em tokens descontados de um saldo. A extensão dessa janela depende do modelo escolhido, da extensão da conversa e da quantidade de texto incluída em cada interação.
Esta é a resposta que raramente é dada, porque as pessoas esperam que um plano funcione como uma chave de API. Uma chave de API desconta um saldo contado em tokens, por isso pode calcular o valor da fatura. Um plano vende acesso a um limite definido e ajustado pela Anthropic. Esse limite é expresso em mensagens, pelo que não existe um número fixo de tokens para indicar. Quem lhe fornecer um número desses está a inventá-lo.
Por isso, faça uma pergunta diferente: o que torna as minhas mensagens dispendiosas? Essa pergunta tem uma resposta concreta e pode agir sobre ela hoje.
Por que uma subscrição não pode indicar um número de tokens
A API cobra cada pedido com base nos tokens. Os tokens de entrada abrangem tudo o que envia, enquanto os tokens de saída abrangem tudo o que o modelo escreve como resposta. As duas categorias têm tarifas diferentes. Por isso, os tokens de entrada e de saída têm custos diferentes antes de fazer qualquer estimativa.
Os planos para consumidores não têm um saldo para gastar. A Anthropic limita o número de mensagens que pode enviar dentro de uma janela móvel. Essa janela começa com a primeira mensagem e termina após um número definido de horas. Os planos pagos têm também um segundo limite, mais longo, medido ao longo de uma semana. Uma mensagem não tem um tamanho fixo. Por isso, o mesmo número de mensagens pode representar uma quantidade de trabalho muito diferente para duas pessoas. As páginas de ajuda da Anthropic descrevem os limites como um número aproximado de mensagens para uma conversa curta. Depois, alertam que conversas longas e anexos grandes consomem a quota mais rapidamente. Esse aviso explica tudo, mas o mecanismo subjacente quase nunca é explicado.
Por que a 20.ª interação de um chat custa muito mais do que a 1.ª
O modelo não mantém memória entre pedidos. Ele é sem estado, por isso reenvia toda a conversa em cada interação: o prompt do sistema, cada mensagem anterior que você escreveu, cada resposta anterior do Claude e cada ficheiro anexado. A sua nova pergunta pode ter vinte palavras. O pedido que a transporta contém toda a transcrição.
Por isso, o custo de uma interação aumenta com o comprimento do chat, de forma linear. As linhas abaixo mostram esse cálculo com um conjunto de pressupostos de exemplo: um prompt do sistema com cerca de 1,000 tokens, mensagens suas com cerca de 1,000 tokens cada e respostas com cerca de 1,200 tokens cada. Estes valores ilustram o mecanismo. Não são uma medição da sua conta.
The data behind this chart
[
{
"label": "Turn 1",
"sent_this_turn": "2,000",
"cumulative_input": "2,000"
},
{
"label": "Turn 5",
"sent_this_turn": "10,800",
"cumulative_input": "32,000"
},
{
"label": "Turn 10",
"sent_this_turn": "21,800",
"cumulative_input": "119,000"
},
{
"label": "Turn 20",
"sent_this_turn": "43,800",
"cumulative_input": "458,000"
}
]Na primeira interação são enviados 2,000 tokens de entrada. Na interação 20, a mesma pergunta curta envia 43,800, mais de vinte vezes esse volume, apesar de você ter escrito a mesma quantidade. Ao longo de toda a conversa, você enviou 458,000 tokens de entrada, e a maior parte desse conteúdo é o mesmo texto reenviado várias vezes.
Vinte chats separados com uma única interação teriam enviado vinte vezes o valor da primeira linha acima, e nada mais. As mesmas perguntas, com uma fração da carga. Os anexos aumentam a diferença, porque um PDF anexado na interação 2 é reenviado na interação 3, na interação 4 e em todas as interações seguintes, mesmo que a conversa já não esteja relacionada com ele.
É por isso que duas pessoas no mesmo plano relatam consumos completamente diferentes. Uma mantém um único tópico aberto durante toda a semana e atinge o limite na quarta-feira. A outra abre um chat novo para cada tarefa e raramente encontra um limite. Nenhuma está a fazer algo errado. O consumo de tokens difere em uma ordem de grandeza porque os hábitos são diferentes.
Na API, pode reduzir o custo da repetição com o prompt caching, que armazena a parte inicial inalterada de um pedido para que as chamadas seguintes sejam cobradas a uma taxa de entrada reduzida nessa parte. Numa subscrição, você não controla o caching, por isso o comprimento da conversa é o fator que realmente pode controlar. O mesmo mecanismo domina as sessões de programação, nas quais o conteúdo dos ficheiros e as definições das ferramentas acompanham cada interação. Por isso, manter pequeno o contexto de uma sessão de programação contribui mais para os seus limites do que qualquer definição, e vale a pena ler para onde vão realmente os tokens de uma sessão do Claude Code antes de atribuir o problema ao plano.
O que cada nível do plano oferece, em termos relativos
Nenhum nível publica um limite absoluto. O que é publicado é relativo, e essa comparação já é suficiente para escolher. O plano Free fica na base, e a capacidade gratuita pode diminuir quando a procura pelo serviço é elevada. O Pro fica acima dele. O Max é vendido em dois tamanhos, descritos como múltiplos da utilização do Pro: aproximadamente cinco vezes e aproximadamente vinte vezes. Os planos Team e Enterprise têm preço por utilizador e limites próprios.
Considere esses multiplicadores uma indicação de intenção, não um contrato. A Anthropic ajusta os limites, e esses ajustes não são anunciados antecipadamente. Por isso, nenhuma página honesta pode fornecer um número de tokens. Para a comparação de custos, quanto custa o Pro e onde ficam os limites e a diferença entre os dois níveis Max explicam essa parte, enquanto o que o plano Free permite na prática explica o limite inferior.
A escolha do modelo é um segundo multiplicador aplicado ao nível do plano. A mesma pergunta consome uma parte maior da sua janela no modelo maior do que no modelo menor, porque executar um modelo mais pesado custa mais por token. Transferir tarefas de rotina do Opus para o Sonnet ou o Haiku costuma proporcionar mais tempo de trabalho do que fazer um upgrade. Por isso, escolher o modelo adequado para cada tarefa é a primeira medida a tentar quando a utilização se esgota repetidamente.
Como ver o seu próprio consumo em vez de adivinhar
A sua própria conta é a única fonte autorizada, e está a dois cliques de distância. Em claude.ai, abra Settings e depois Usage. A página mostra o que consumiu na janela atual e quando essa janela é reiniciada. Consulte-a quando as respostas começarem a ser recusadas e novamente depois de uma sessão longa. Assim, aprenderá o seu próprio padrão mais depressa do que qualquer valor publicado poderia indicar.
No Claude Code, dois comandos slash fazem o mesmo a partir do terminal. /usage mostra o consumo do plano e a hora de reinício. /context detalha o que está a ocupar a janela de contexto neste momento, separando o prompt do sistema, as definições das ferramentas, os ficheiros e o histórico da conversa. Quando /context mostra que a conversa antiga ocupa a maior parte do contexto, /clear inicia uma sessão nova e o custo por turno volta a aproximar-se da primeira linha do gráfico acima.
Na API, a contagem é exata e pode consultá-la antes de enviar qualquer coisa:
curl https://api.anthropic.com/v1/messages/count_tokens \
--header "x-api-key: $ANTHROPIC_API_KEY" \
--header "anthropic-version: 2023-06-01" \
--header "content-type: application/json" \
--data '{
"model": "claude-sonnet-5",
"messages": [{"role": "user", "content": "Summarise the attached report."}]
}'Uma resposta válida contém um único campo, que corresponde ao número usado para a faturação:
{"input_tokens": 14}Cada pedido concluído apresenta os mesmos dados de contabilização quando termina:
{"usage": {"input_tokens": 21430, "output_tokens": 512}}Envie uma pergunta curta num pedido novo e, depois, envie essa mesma pergunta no fim de uma conversa longa. Compare os dois valores de input_tokens. A diferença mostra exatamente o efeito que a sua subscrição contabiliza, expresso num número.
O que fazer quando o limite é atingido durante uma tarefa
- Aguarde a janela. A aplicação mostra a hora de reposição, e a espera é muitas vezes mais curta do que a solução alternativa. Esta é a decisão certa quando não há nada pendente.
- Mude para um modelo mais leve. Um modelo menor custa menos por interação em todos os planos e, em alguns planos, usa uma quota separada. Assim, o trabalho continua enquanto o modelo mais pesado aguarda.
- Inicie uma nova conversa levando apenas o que o passo seguinte precisa. Cole a conclusão, não a transcrição. O custo por interação diminui imediatamente, e as respostas costumam melhorar porque o modelo deixa de avaliar milhares de tokens de uma discussão já resolvida.
- Transfira o trabalho para a API, onde os tokens são contabilizados por pedido e cobrados por token. Não há nenhuma janela a aguardar, e pode ver o preço de cada chamada antes e depois de a efetuar.
A opção adequada depende de saber se o problema é o relógio ou a carga de trabalho. Uma necessidade pontual é um problema de tempo. Um limite atingido todas as quartas-feiras é um problema de carga de trabalho e requer a API ou um plano maior, não um melhor ajuste de tempo. a lista de verificação completa para um limite atingido durante uma tarefa apresenta a recuperação passo a passo, e como as janelas deslizantes abrem e são repostas explica por que motivo o relógio funciona dessa forma. Se pretende usar a API, calcule primeiro o custo: a API comparada com uma subscrição para a mesma carga de trabalho e quanto custam realmente um milhão de tokens apresentam os cálculos antes da mudança.
FAQ
Quantos tokens o Claude Pro inclui?
A Anthropic não publica uma quota de tokens para o Pro e, em setembro de 2026, não existe um número desse tipo para citar. O Pro é medido em mensagens dentro de uma janela contínua, com um limite mais longo calculado ao longo de uma semana. A quantidade de mensagens que cabe varia consoante o modelo e o comprimento da conversa. Qualquer página que indique um número mensal específico de tokens para o Pro está a fazer uma estimativa. Abra Settings e depois Usage em claude.ai para ver o seu próprio consumo e o tempo até à reposição.
Iniciar uma nova conversa repõe a utilização?
Não. A utilização é contabilizada para a sua conta em toda a janela, por isso uma nova conversa não devolve o que já gastou. O que muda é o custo de cada interação a partir desse momento. Uma nova conversa não tem um histórico para reenviar, por isso começa na parte inferior do gráfico acima em vez de continuar a aumentar. Abrir uma conversa nova quando o tema muda é o hábito mais económico disponível em qualquer plano.
Por que motivo atingi o limite mais depressa hoje do que ontem?
Normalmente, porque o trabalho de hoje decorreu num único tópico longo. A cada interação, toda a conversa e quaisquer ficheiros anexados são reenviados, por isso o custo por mensagem aumenta progressivamente, embora a contagem de mensagens pareça inalterada para si. A outra causa comum é o modelo: os modelos mais pesados consomem a quota mais depressa em cada interação, por isso uma tarde no modelo maior termina antes do que uma manhã num modelo mais pequeno.
Devo mudar para a API para obter uma contagem real de tokens?
Mude se precisar dos números ou de previsibilidade. A API contabiliza os tokens de entrada e de saída em cada chamada, disponibiliza um endpoint de contagem de tokens que pode executar antes de enviar o pedido e não tem uma janela que precise de aguardar. A faturação é feita por token, por isso uma utilização intensa custa mais do que uma subscrição fixa e uma utilização ligeira custa muito menos. Calcule o custo da sua carga de trabalho real em comparação com o plano atual antes de mudar, porque a resposta depende da quantidade de tokens que envia.