Claude Pro em português: limites e tokens
Entenda por que o Claude Pro acaba antes em português: o limite usa tokens, não mensagens, e o mesmo texto pode consumir mais tokens que em inglês.
Por que o Claude Pro se esgota mais depressa em português?
No Claude Pro, o limite de utilização em português é atingido mais cedo do que ao fazer o mesmo trabalho em inglês, porque o limite é medido em tokens e o português transforma o mesmo conteúdo em mais tokens do que o inglês. Um token é um pequeno fragmento de texto, geralmente com alguns caracteres. O modelo lê tokens e escreve tokens, e o seu plano contabiliza tokens.
Numa pergunta curta, a diferença é pequena o suficiente para ser ignorada. Numa conversa longa, não é, porque cada interação reenvia todo o histórico da conversa como entrada. Se cada uma das suas mensagens custar mais vinte por cento de tokens, cada cópia posterior dessa mensagem também custará mais vinte por cento. É por isso que um plano que parecia generoso numa análise em inglês se esgota por volta da sua trigésima resposta.
Seu limite é consumido pelo volume de texto, não pela quantidade de mensagens
A Anthropic afirma isso na sua própria página do plano Pro. Em setembro de 2026, o texto diz: "O número de mensagens que você pode enviar varia conforme o tamanho das mensagens, incluindo o tamanho dos arquivos anexados, o tamanho da conversa atual e o modelo ou recurso utilizado."
Todos os fatores dessa frase representam uma quantidade de texto. Nenhum deles é uma contagem de mensagens. Portanto, "quantas mensagens eu recebo no Pro" não tem uma resposta fixa. A forma correta de fazer a pergunta é "quanto texto eu recebo". A mesma página informa que o limite da sessão é redefinido a cada cinco horas e que o Pro também tem um limite semanal, redefinido em um horário fixo atribuído à sua conta. Para entender apenas o funcionamento dessas janelas, como o Claude contabiliza um limite de uso explica o mecanismo, e o que fazer quando o limite é atingido no meio de uma tarefa explica como recuperar o acesso.
Por que o português custa mais tokens do que o inglês
Duas causas distintas somam-se.
A primeira é a própria língua. O português traduzido costuma ser mais longo do que o texto original em inglês. "Configuration file" tem 18 caracteres. "Arquivo de configuração" tem 23. Mais caracteres significam mais tokens antes de qualquer modelo ser envolvido.
A segunda causa é o tokenizador, e o efeito é maior. Um tokenizador é ajustado com base num corpus de treino e aprende a combinar as sequências de caracteres que aparecem com mais frequência em tokens individuais. O inglês está sobrerrepresentado nesse corpus, por isso formas comuns de palavras inglesas tornaram-se um token cada. Muitas formas portuguesas não se tornaram, por isso são divididas em partes, e cada parte é um token. As letras acentuadas agravam este efeito, porque o tokenizador trabalha com bytes, e uma letra como "ç" ou "ã" ocupa dois bytes em UTF-8 (unicode transformation format, 8 bit), em vez de um.
Pode observar isto diretamente, em vez de aceitar a explicação sem verificar. Conte a palavra coração isoladamente e depois conte heart isoladamente, usando o comando da secção seguinte. Não use um número fornecido por mim para avaliar a dimensão dessa diferença. O endpoint informará o valor para o seu modelo, hoje.
Meça a diferença em vez de reutilizar uma proporção antiga
Uma proporção como "o português custa 1,5 vezes o inglês" é repetida por terceiros e fica desatualizada sem chamar atenção. Isso acontece por uma razão que pode verificar: o tokenizador muda entre gerações de modelos.
The data behind this chart
[
{
"label": "Before Claude Opus 4.7",
"words_per_1m_tokens": "750,000"
},
{
"label": "Claude Opus 4.7 and later",
"words_per_1m_tokens": "555,000"
}
]A visão geral dos modelos da Anthropic, consultada em setembro de 2026, indica que cabem cerca de 750,000 palavras em inglês num milhão de tokens com o tokenizador mais antigo, e cerca de 555,000 com o tokenizador introduzido no Claude Opus 4.7. A documentação da Anthropic sobre contagem de tokens afirma o mesmo diretamente: o mesmo texto de entrada produz aproximadamente mais trinta por cento de tokens no tokenizador mais recente, e o aumento exato depende do conteúdo. Uma proporção medida há duas gerações de modelos já não é a sua proporção.
Por isso, faça a sua própria medição. Existe um endpoint de contagem de tokens para esse fim. Ele pertence à API de programador (application programming interface), que usa uma conta separada e uma faturação separada da sua subscrição Claude Pro. Portanto, contar tokens não consome a utilização do seu plano Pro. Precisa de uma chave de API da Anthropic Console. A contagem é gratuita e tem o seu próprio limite de taxa, independente da criação de mensagens.
Envie primeiro o parágrafo em português:
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-sonnet-5",
"messages": [{"role": "user", "content": "Preciso de ajuda para configurar um servidor web em um VPS com Ubuntu. Já instalei o Nginx, mas o certificado TLS não está sendo emitido e o navegador mostra um aviso de segurança em todas as páginas."}]
}'Depois envie a tradução inglesa do mesmo parágrafo, sem alterar mais nada:
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-sonnet-5",
"messages": [{"role": "user", "content": "I need help setting up a web server on an Ubuntu VPS. Nginx is installed, but the TLS certificate is not being issued and the browser shows a security warning on every page."}]
}'Cada chamada responde com uma única linha:
{"input_tokens": 14}Esse 14 é a contagem do exemplo de duas palavras da própria documentação da Anthropic, apresentado aqui para que saiba qual é o formato de uma resposta válida. O seu parágrafo devolve um número muito maior. Divida a contagem em português pela contagem em inglês para obter a sua proporção, para esse texto, nesse modelo e nesse dia. Um HTTP 401 com authentication_error significa, em vez disso, que a chave em x-api-key está ausente ou incorreta.
Método completo, para que possa repeti-lo ou para que outra pessoa o possa repetir
Registe quatro elementos junto de cada resultado: o texto exato que enviou, o valor de model que enviou, a data em que executou o teste e o input_tokens que recebeu. O modelo é relevante porque a contagem vem do tokenizador desse modelo. A data é relevante porque os tokenizadores mudam entre gerações, como mostra o gráfico acima.
Há duas limitações importantes quanto a esse número. A documentação da Anthropic afirma que a contagem é uma estimativa e que um pedido real pode diferir ligeiramente. Além disso, o endpoint conta apenas a entrada. A resposta do Claude também é contabilizada, e a saída é a parte mais cara do cálculo. a diferença entre tokens de entrada e de saída explica isso corretamente.
Repita o par de testes com um texto semelhante ao seu trabalho real, não com apenas um parágrafo de exemplo. Um pedido de suporte e um traceback de Python não têm necessariamente a mesma proporção. Código, saída de logs e números variam pouco entre idiomas. O texto corrente varia mais. Por isso, publicar uma única proporção seria enganador: o número depende do seu texto, não do idioma.
Por que as conversas longas terminam mais cedo
O modelo não tem memória entre turnos. A transcrição completa é enviada novamente como entrada em cada turno. É por isso que a Anthropic lista o tamanho da conversa atual como um fator do seu limite. O turno 20 envia novamente os turnos 1 a 19, além da sua nova mensagem.
Vale a pena fazer as contas uma vez. Suponha que cada turno acrescente cerca de 1,000 tokens. O turno 1 envia 1,000. O turno 10 envia cerca de 10,000. Em conjunto, dez turnos terão enviado cerca de 55,000 tokens de entrada para transportar 10,000 tokens de texto novo. Agora multiplique cada um desses valores pelo seu rácio medido para português. O aumento aplica-se tanto ao histórico reenviado como à nova mensagem. Por isso, cresce com a conversa, e não apenas com a mensagem.
Essa é a resposta direta para “por que parou depois de tão poucas mensagens”. O contador nunca contou mensagens. Ele somou uma transcrição que continuou a ficar mais longa.
Quatro alterações que fazem uma subscrição Pro durar mais
- Inicie uma nova conversa quando o assunto mudar. Uma thread nova não reenvia nada, por isso o primeiro turno tem um custo baixo. Continuar a thread de ontem por hábito é a opção mais dispendiosa desta lista.
- Agrupe perguntas relacionadas numa única mensagem. A página de boas práticas para limites de utilização da Anthropic recomenda agrupar várias tarefas relacionadas numa única mensagem. O motivo é o reenvio: quatro turnos separados transportam o histórico quatro vezes, enquanto um único turno o transporta apenas uma vez.
- Anexe um documento em vez de o colar e nunca cole o mesmo documento duas vezes. Um anexo não é gratuito, porque a Anthropic indica o tamanho dos ficheiros anexados como um dos fatores. A vantagem é que um anexo é um único item que pode remover ou levar para uma conversa nova, enquanto o texto colado permanece na transcrição durante toda a vida da thread e é reenviado em todos os turnos seguintes.
- Desative os conectores e as ferramentas que não está a utilizar nessa conversa. As respetivas definições são enviadas como entrada em todos os turnos, e as orientações de utilização da Anthropic descrevem as ferramentas e os conectores como elementos que consomem muitos tokens.
Fazer prompts em inglês ajuda mesmo?
Ajuda, mas tem um custo. Por isso, decida com base nos seus próprios números.
Escreva a instrução em inglês e peça a resposta em português. Assim, o lado de entrada de cada interação fica menor. O lado de entrada é a parte reenviada, portanto essa poupança acumula-se ao longo da conversa. A resposta continua em português e mantém a contagem de tokens do português. A saída também é contabilizada. A poupança é real, mas parcial.
O custo é que o prompt passa a estar na sua segunda língua. Um prompt vago gera uma resposta vaga, e uma nova tentativa custa mais do que os tokens poupados. Se o seu inglês for mais fraco do que o seu português, escreva em português e reduza o tamanho das conversas. Essa alteração não tem custo e incide sobre o termo maior da equação.
Quando a próxima categoria de plano é realmente a resposta?
Meça durante uma semana antes de pagar mais. Mantenha as conversas curtas e agrupe as suas perguntas. Depois, observe se continua a atingir o limite. Se isso acontecer, tem um problema de capacidade, e um plano maior resolve-o. Se o limite só aparecer na mensagem sessenta de uma conversa enorme, um plano maior apenas permite prolongar o mesmo hábito.
Se vai fazer um upgrade, as páginas dos planos apresentam os valores, em vez de os repetirmos aqui: quanto custa o Pro e quais são realmente os seus limites, que perguntas responder antes de passar para o Max e a diferença entre os dois níveis do Max. Para leitores que pagam em reais, quanto custa realmente uma assinatura Claude Pro no Brasil aborda a conversão e os impostos, que normalmente influenciam mais a decisão do que a proporção de tokens. E se a sua carga de trabalho for orientada pela API, e não pelo chat, quanto custa um milhão de tokens ao preço de tabela é a comparação a fazer, juntamente com se uma assinatura Pro compensa para o seu tipo de trabalho.
FAQ
As mensagens ou os tokens contam para o Claude Pro?
A página do plano Pro da Anthropic diz que o número de mensagens varia consoante o comprimento da mensagem, o tamanho dos ficheiros anexados, o comprimento da conversa atual e o modelo ou a funcionalidade utilizados. Em setembro de 2026, todos esses fatores correspondem a uma quantidade de texto. Por isso, o limite mede o volume de texto, e não apenas o número de mensagens. Cem perguntas de uma linha e dez conversas longas com um PDF anexado não representam a mesma carga, mesmo que o número de mensagens seja semelhante.
Quanto mais custa o português do que o inglês no Claude?
Não existe um valor único. Quem apresenta um valor mediu apenas uma amostra, num modelo específico. Envie o mesmo parágrafo duas vezes para https://api.anthropic.com/v1/messages/count_tokens, uma em português e outra em inglês, e divida os dois valores de input_tokens. O texto corrido é o que mais varia. O código, a saída de logs e os números quase não variam. Registe o id do modelo e a data junto do resultado, porque o tokenizador mudou entre gerações de modelos e o seu rácio também muda.
Devo escrever os prompts em inglês para poupar o limite do Claude Pro?
Isso reduz a parte de entrada de cada interação. Como a entrada é reenviada, a poupança aumenta ao longo da conversa. A resposta continua a ser em português e também é contabilizada, portanto o efeito é parcial. Considere o risco de escrever um prompt menos preciso numa segunda língua. Normalmente, uma repetição do pedido custa mais do que os tokens poupados.
Porque é que uma conversa longa atinge o limite mais depressa do que várias conversas curtas?
Porque toda a transcrição é reenviada como entrada em cada interação. Dez interações numa conversa reenviam as primeiras interações dez vezes. Dez interações distribuídas por cinco conversas novas reenviam muito menos conteúdo, porque cada conversa nova começa sem histórico. Iniciar uma nova conversa quando o assunto muda é a alteração de hábito mais económica que pode fazer.
O endpoint de contagem de tokens consome a utilização do meu Claude Pro?
Não. A contagem de tokens pertence à API para programadores. Esta API usa uma conta separada e tem uma faturação separada da subscrição Claude Pro. A documentação da Anthropic indica que a contagem de tokens é gratuita, com um limite próprio de pedidos por minuto, independente da criação de mensagens. Precisa de uma chave de API da Console para a chamar. A chamada não afeta o limite da sessão Pro nem o limite semanal.