A memória do Claude tem custo extra?
A Anthropic não publica preço para tokens de memória: o texto lembrado é reenviado como entrada, cobrado normalmente, ou servido pelo cache.
Os recursos de memória do Claude têm custos adicionais?
Os recursos de memória do Claude não têm um preço próprio. As tarifas publicadas pela Anthropic são calculadas por milhão de tokens de entrada e por milhão de tokens de saída, com tarifas adicionais para o armazenamento em cache de prompts. Nenhuma delas é denominada token de memória. O armazenamento da própria memória não tem custo na Claude API (interface de programação de aplicações), porque a ferramenta de memória é executada no lado do cliente e o ficheiro fica num armazenamento que lhe pertence.
A memória ainda afeta a sua fatura, porque um facto memorizado só altera uma resposta quando está incluído no pedido que o Claude lê. Memorizar significa reenviar. Esse texto chega como tokens de entrada e é cobrado à tarifa normal de entrada do modelo. Dois números determinam o custo: quantos tokens do texto memorizado são reenviados em cada turno e se esse texto reenviado pode ser servido a partir do cache de prompts.
Numa subscrição Pro ou Max, não há cobrança por token, por isso a memória consome o seu limite de utilização, e não o seu dinheiro. O mecanismo abaixo é idêntico. Apenas muda a unidade. Esse limite é finito, por isso vale a pena saber quanto custa o Claude Pro e em que ponto os limites o impedem de continuar antes de decidir quanta memória cada turno deve transportar. O Claude Enterprise funciona de forma diferente, porque contabiliza cada token segundo as tarifas da API além do preço por licença, fazendo com que um bloco de memória demasiado grande volte a representar um custo em dinheiro, e não um consumo do limite. Se reduzir a memória fizer com que a sua utilização fique confortavelmente abaixo do limite de um plano mais pequeno, passar do Max para o Pro é o passo seguinte a considerar. A alteração entra em vigor no final do período que já pagou. Se a comparação que está realmente a fazer for entre fornecedores, e não entre os próprios níveis da Anthropic, comparar os planos do Claude com os do ChatGPT aos preços atuais é o ponto de partida.
O que significa "memória" em cada superfície do Claude
Três produtos distintos usam esta palavra, e confundi-los é a principal razão pela qual esta questão parece confusa.
A ferramenta de memória na API do Claude. Adicione uma entrada ao array tools e implemente as operações de ficheiros no seu próprio código.
{"type": "memory_20250818", "name": "memory"}Em agosto de 2026, esta ferramenta está geralmente disponível na Messages API sem um cabeçalho beta, nos modelos Claude 4 e posteriores. É do lado do cliente: o Claude solicita uma operação como view /memories, o seu handler executa-a no armazenamento que controla e devolve o resultado num bloco tool_result. A Anthropic nunca armazena o ficheiro, pelo que não há custos de armazenamento a repercutir. O custo corresponde à comunicação de ida e volta. A definição da ferramenta é enviada em todos os pedidos, e o conteúdo do ficheiro devolvido permanece na conversa a partir desse momento.
A Anthropic publica a parte fixa desse overhead. No Claude Opus 5, com uma escolha de ferramenta auto, o prompt de sistema para utilização de ferramentas tem 286 tokens, conforme documentado em agosto de 2026. Esse custo é aplicado uma vez por pedido sempre que existe qualquer ferramenta, seja de memória ou de outro tipo.
Claude Code. Dois mecanismos são carregados no início de cada sessão. Os ficheiros CLAUDE.md contêm as instruções que escreve. A memória automática contém notas que o Claude escreve para si próprio, em ~/.claude/projects/<project>/memory/. Apenas as primeiras 200 linhas ou 25KB de MEMORY.md são carregadas, consoante o limite atingido primeiro, e os ficheiros de tópicos junto desse ficheiro são lidos quando necessários, não no arranque. Tudo o que é carregado no arranque passa a fazer parte do prefixo transportado por todos os pedidos seguintes dessa sessão. Como o Claude Code recupera a memória entre sessões explica a ordem de carregamento, ficheiro a ficheiro.
Claude na Web. Em claude.ai, a memória é um conjunto de entradas que o Claude escreve e atualiza enquanto conversa consigo, com um espaço de memória separado para cada projeto. Settings > Memory apresenta o que está armazenado, e o seletor nessa área disponibiliza Pause memory ou Reset memory. Esta superfície é faturada por subscrição, pelo que a memória utiliza os limites de utilização.
Por que o texto memorizado é cobrado como tokens de entrada
A Messages API não tem estado. Não mantém nada entre chamadas, por isso o seu cliente envia a conversa completa em cada turno e o modelo lê tudo novamente. A memória não é uma exceção a essa regra. É mais um bloco de texto no mesmo pedido.
A divisão é visível no objeto usage de qualquer resposta.
"usage": {
"input_tokens": 412,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 18240,
"output_tokens": 236
}input_tokens contabiliza apenas os tokens que não foram lidos da cache nem utilizados para a criar. Na prática, isto significa os tokens depois do último ponto de cache. O total de tokens de entrada do pedido é cache_read_input_tokens mais cache_creation_input_tokens mais input_tokens. Um ficheiro de memória que Claude abriu há três turnos continua incluído nesse total em cada turno seguinte. Fica em cache_read_input_tokens enquanto o prefixo em cache for utilizado e em input_tokens quando não for. O mesmo texto tem dois preços muito diferentes. Os tokens de entrada e de saída têm preços diferentes, e a memória é sempre contabilizada como entrada.
Onde ver estes números na sua própria utilização
Não use um valor de uma publicação num blogue, incluindo esta. Meça o seu próprio bloco de memória. A contagem de tokens é gratuita e tem o seu próprio limite de taxa, por isso a medição não tem qualquer custo.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{"role": "user", "content": "Hello, Claude"}]
}'A resposta é um número, como { "input_tokens": 14 }. Execute-o uma vez com o texto da sua memória colado no campo system e outra vez sem esse texto. A diferença é o custo dessa memória em cada turno. Aplicam-se duas ressalvas. A contagem é uma estimativa, e os tokens adicionais que a Anthropic acrescenta para as suas próprias otimizações do sistema não lhe são cobrados. Conte também com o modelo que vai realmente executar, porque o Claude 4.7 e versões posteriores usam um tokenizador mais recente, que produz aproximadamente 30 por cento mais tokens para o mesmo texto.
No Claude Code, a mesma pergunta pode ser respondida sem qualquer curl.
/contextmostra o que está carregado neste momento, incluindo os ficheiros de memória, para que possa ver a respetiva parcela da janela antes de escrever./memorylista os seus ficheiros CLAUDE.md e abre a pasta de memória automática./usageapresenta os totais da sessão, incluindo leituras e escritas de cache.- A linha de estado pode apresentar continuamente a utilização da janela de contexto, para que o crescimento seja visível enquanto ocorre.
O bloco de sessão /usage tem este aspeto:
Total cost: $0.55
Total duration (API): 6m 20s
Total duration (wall): 6h 33m 10s
Total code changes: 0 lines added, 0 lines removed
Usage by model:
claude-sonnet-4-6: 1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)Leia atentamente a última linha. O valor de leitura de cache de 940.0k corresponde à conversa, incluindo toda a memória, que é enviada novamente em cada turno à tarifa de cache. O valor de entrada de 1.2k corresponde apenas à parte nova. O Claude Code calcula localmente esse valor em dólares a partir dos preços de tabela, por isso ignora qualquer desconto que tenha e pode diferir da sua fatura. A página Usage na Claude Console é o valor oficial.
Em seguida, execute diretamente a comparação. Faça a mesma pergunta inicial em duas sessões novas: uma normal e outra com a memória automática desativada.
CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 claudeExecute /context em cada sessão e compare a entrada dos ficheiros de memória. A diferença corresponde ao custo da memória acumulada no início de cada sessão, antes de qualquer trabalho ser executado. Uma explicação completa de para onde vai a utilização de tokens do Claude Code merece ser lida juntamente com esses dois números.
Quanto custa reproduzir a memória por milhão de tokens?
O armazenamento em cache de prompts explica por que o mesmo bloco de memória pode custar dez vezes mais num turno do que noutro. A Anthropic publica as tarifas de cache como múltiplos do preço base de entrada de cada modelo. Por isso, a relação mantém-se mesmo quando os preços em dólares mudam.
The data behind this chart
[
{
"label": "Base input",
"price_multiple": 1
},
{
"label": "5 minute cache write",
"price_multiple": 1.25
},
{
"label": "1 hour cache write",
"price_multiple": 2
},
{
"label": "Cache read",
"price_multiple": 0.1
}
]Uma leitura da cache custa 0.1 vezes o preço base de entrada. Escrever uma entrada com validade de 5 minutos custa 1.25 vezes o preço base, e uma entrada com validade de 1 hora custa 2 vezes o preço base. A Anthropic indica claramente o ponto de equilíbrio: o armazenamento em cache compensa depois de uma leitura da cache com duração de 5 minutos, ou depois de duas leituras da cache com duração de 1 hora. O ponto de equilíbrio do armazenamento em cache de prompts é o cálculo a fazer antes de decidir onde a memória deve ficar.
Esses múltiplos transformam o número de reproduções em aritmética. O bloco seguinte é um cálculo baseado nos múltiplos publicados acima, não uma medição de uma carga de trabalho ativa. Ele calcula o custo de um bloco de memória de três formas ao longo de uma sessão de 100 turnos, expresso como o número equivalente de tokens cobrados à taxa base de entrada.
The data behind this chart
[
{
"label": "4,000 tokens, never cached",
"base_rate_equivalent_tokens": "400,000"
},
{
"label": "4,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "44,600"
},
{
"label": "1,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "11,150"
}
]Um bloco de memória de 4,000 tokens que falha na cache em todos os 100 turnos é cobrado como 400,000 tokens à taxa base. O mesmo bloco, com uma escrita numa cache de 5 minutos e 99 leituras da cache, é cobrado como 44,600. Se o reduzir para um quarto do tamanho e mantiver o armazenamento em cache, é cobrado como 11,150. A funcionalidade não mudou entre essas 3 linhas. Apenas o comportamento de reprodução mudou. Estes continuam a ser números de tokens, não valores monetários, e converter um número de tokens num valor na sua fatura mensal exige uma multiplicação pela tarifa do seu modelo por milhão de tokens. Essa tarifa é definida pelo modelo que executa. Por isso, se o agente for executado no Claude Fable 5, comece por consultar as tarifas publicadas por milhão de tokens e o trabalho a que o modelo se adequa. Se o fornecedor ainda for uma questão em aberto, e não apenas o modelo, os mesmos trabalhos calculados na API da Claude e no ChatGPT mostram onde essa multiplicação produz resultados diferentes. Um agente com uso intensivo de memória depende sobretudo do custo de entrada.
A segunda linha pressupõe que cada um dos 99 pedidos posteriores chega enquanto a entrada da cache ainda está válida. É essa pressuposição que provoca a maioria dos erros nas faturas reais.
Por que a mesma pergunta custa mais depois de uma pausa?
Uma entrada de cache tem um tempo de vida, e o relógio começa a contar quando o pedido a grava ou lê. O padrão é 5 minutos. A opção de 1 hora custa 2x a gravação indicada acima. No Claude Code, o tempo de vida é de uma hora numa subscrição e passa para cinco minutos quando utiliza créditos de utilização; com uma chave de API ou um fornecedor de cloud, o padrão é cinco minutos. Definir ENABLE_PROMPT_CACHING_1H=1 mantém o tempo de vida de uma hora quando utiliza créditos de utilização.
Por isso, uma pergunta de uma linha introduzida numa sessão que deixou aberta durante o almoço fica cara porque a entrada de cache expirou enquanto esteve ausente. Todo o prefixo, incluindo a memória, é processado novamente à taxa base de entrada e gravado novamente na cache. A duração da pausa determinou esse preço.
Pode confirmar isto em vez de aceitar a explicação sem verificar. Num plano Pro, Max, Team ou Enterprise, a discriminação /usage assinala qualquer comportamento responsável por 10 por cento ou mais da utilização recente, e tanto o contexto longo como as falhas de cache aparecem ali pelo nome. Na API, monitorize cache_creation_input_tokens: após um período de inatividade, o valor volta a aumentar até ao tamanho total do prefixo no primeiro pedido.
O que invalida silenciosamente o cache
O prefixo armazenado em cache segue uma ordem: ferramentas, depois sistema e, por fim, mensagens. Uma alteração num nível invalida esse nível e tudo o que vem depois dele. Editar uma definição de ferramenta descarta todo o cache. Editar o prompt do sistema descarta o cache do sistema e das mensagens.
Esta é a armadilha para quem mantém memória no prompt do sistema e o reescreve à medida que o agente aprende. Cada reescrita descarta a cópia armazenada em cache de tudo o que vem depois dela, por isso o pedido seguinte volta a pagar uma gravação completa. Mantenha o material estável no início e não o altere. Coloque o material volátil no fim da lista de mensagens, onde a invalidação tem um custo baixo.
Existe uma segunda falha, mais silenciosa. Cada modelo tem um prefixo mínimo que pode ser armazenado em cache: 512 tokens no Claude Opus 5, 1,024 no Claude Sonnet 5 e 4,096 no Claude Haiku 4.5, conforme publicado em agosto de 2026. A documentação da Anthropic explica explicitamente o que acontece abaixo desse limite: "Qualquer pedido para armazenar em cache menos tokens do que este número será processado sem cache, e nenhum erro será devolvido." Por isso, um ficheiro de memória pequeno marcado com cache_control não faz absolutamente nada, de forma silenciosa. O sintoma observável é cache_creation_input_tokens permanecer em 0 enquanto o prompt contém claramente um ponto de quebra.
Podar memória que já não justifica o seu lugar
Cada linha de memória consome tokens em todas as interações que a incluem. Por isso, a pergunta para cada linha é se ela alterou recentemente uma resposta. Claude Code torna estes limites concretos. Procure manter um CLAUDE.md com menos de 200 linhas, porque os ficheiros maiores consomem mais contexto e reduzem a capacidade de Claude de os seguir de forma consistente. MEMORY.md fica limitado às primeiras 200 linhas ou a 25KB no carregamento, e todo o conteúdo além desse limite é descartado no início da sessão seguinte. Um índice demasiado grande consome tokens sem transmitir informação útil.
Dois hábitos ajudam a mantê-lo pequeno. Retire os detalhes do índice e coloque-os em ficheiros por tópico. Claude lê esses ficheiros quando necessário, em vez de os carregar no arranque. Retire também as instruções de fluxo de trabalho do CLAUDE.md e coloque-as em skills, que só são carregadas quando invocadas. Nos ficheiros de memória que já começam com frontmatter, o Claude Code regista a hora de escrita no campo modified como um timestamp ISO 8601, na versão 2.1.214 ou posterior. Esse timestamp é a forma mais rápida de identificar um facto que ficou desatualizado. Podar memória desatualizada explica o processo de revisão com mais detalhe.
Quando a recuperação é melhor do que carregar tudo no contexto
A ferramenta de memória existe para permitir a recuperação just-in-time. Em vez de carregar tudo antecipadamente, o agente regista o que aprende e lê um ficheiro apenas quando uma tarefa precisa dele. Isto altera os cálculos, porque a leitura de um ficheiro custa os respetivos tokens uma vez e depois fica dentro do prefixo em cache, enquanto um bloco carregado permanentemente tem esse custo em cada turno.
Dos dois gráficos anteriores resulta uma regra simples. O texto usado em quase todos os turnos pertence ao prefixo estável em cache. O texto usado num turno em vinte deve ficar atrás de uma chamada view. O ponto de equilíbrio varia com o número de repetições, não com qualquer valor cobrado pela Anthropic.
Na API, também pode permitir que a plataforma reduza a conversa. A edição do contexto limpa resultados antigos de ferramentas quando a conversa ultrapassa um limite definido por si.
{
"edits": [
{
"type": "clear_tool_uses_20250919",
"trigger": {"type": "input_tokens", "value": 30000},
"keep": {"type": "tool_uses", "value": 3},
"clear_at_least": {"type": "input_tokens", "value": 5000}
}
]
}As predefinições são um acionador de 100,000 tokens de entrada e 3 utilizações de ferramentas mantidas. Leia a interação com o sistema de cache antes de a ativar: limpar conteúdo invalida o prefixo em cache no ponto da limpeza, pelo que paga uma gravação da cache no pedido seguinte. É para isso que serve clear_at_least. Esta opção adia a limpeza até que a poupança seja suficiente para justificar a gravação. A resposta apresenta exatamente o que aconteceu em context_management, com cleared_tool_uses e cleared_input_tokens, para que o compromisso possa ser medido e não seja apenas teórico. Gerir a janela de contexto no Claude Code aplica a mesma ideia a uma sessão de programação.
O que tem uma linha de custo própria
A memória não tem um custo próprio, mas algumas funcionalidades têm, e é importante saber quais. Estas são as tarifas publicadas da Claude API em agosto de 2026. Algumas operações não têm qualquer custo, mas não existe um nível gratuito na Claude API, apenas um pequeno crédito no registo, portanto tudo o que aparece abaixo representa despesa real desde o primeiro pedido.
- Pesquisa na Web: $10 por 1.000 pesquisas, além do custo normal dos tokens de todo o conteúdo que a pesquisa colocar no contexto.
- Execução de código: 1.550 horas gratuitas por organização todos os meses; depois, $0.05 por hora e por contentor. É gratuita quando utilizada em conjunto com a pesquisa na Web ou a obtenção de conteúdo da Web.
- Claude Managed Agents: tempo de execução da sessão a $0.08 por hora de sessão, além dos custos habituais dos tokens.
- Obtenção de conteúdo da Web: sem custo adicional; paga apenas o custo dos tokens do conteúdo obtido.
A memória não aparece em nenhuma dessas linhas. Ela aparece na contagem dos tokens de entrada, exatamente onde pode medi-la e onde a redução e o armazenamento em cache podem diminuir o custo. Se estiver a calcular o orçamento de um agente executado sem supervisão num servidor privado virtual (VPS), os controlos de custos para um agente de IA num VPS são a próxima medida a implementar, porque um agente com um ficheiro de memória em crescimento e sem redução fica mais caro todas as semanas sem que isso seja comunicado.
FAQ
Existe uma cobrança separada pelas funcionalidades de memória do Claude?
Não. A tabela de preços da Anthropic apresenta valores por milhão de tokens de entrada, por milhão de tokens de saída e os múltiplos de cache de prompts, sem uma linha específica para memória. Na API do Claude, a ferramenta de memória é executada no lado do cliente, portanto os ficheiros ficam num armazenamento que já paga. O que a memória acrescenta são tokens de entrada, cobrados à taxa normal de entrada do modelo em cada turno que os inclui.
Desativar a memória torna o Claude mais barato?
Reduz a contagem de tokens de cada pedido, o que reduz o custo de cada pedido. Se isso poupa dinheiro no total depende do que acontece depois. Se o Claude tiver de voltar a ler três ficheiros e fazer-lhe duas perguntas para reconstruir o que a memória já continha, esses tokens custam mais do que a memória. Meça em vez de adivinhar: execute /context numa sessão com a memória automática ativada e noutra iniciada com CLAUDE_CODE_DISABLE_AUTO_MEMORY=1, e compare o total de tokens gastos na mesma tarefa.
Porque é que o meu consumo aumentou quando não alterei nada?
A causa mais comum é uma falha de cache depois de uma pausa. As entradas de cache permanecem durante 5 minutos por predefinição, ou durante uma hora na definição prolongada. Por isso, o primeiro pedido depois de uma pausa processa novamente todo o seu prefixo à taxa base de entrada e grava-o outra vez. A segunda causa mais comum é uma edição do prefixo: alterar uma definição de ferramenta invalida todo o cache, e alterar o prompt do sistema invalida o cache do sistema e das mensagens. Num plano de subscrição, a discriminação /usage identifica este comportamento quando ele representa 10 por cento ou mais do consumo recente.
A memória deve ficar no prompt do sistema ou atrás de uma chamada de ferramenta?
Coloque-a no prompt do sistema quando quase todos os turnos a utilizarem, porque assim fica no prefixo colocado em cache e é cobrada à taxa de leitura do cache. Coloque-a atrás de uma chamada view quando apenas algumas tarefas precisarem dela, porque um ficheiro lido uma vez custa os respetivos tokens uma vez, em vez de em todos os turnos. O número determinante é a sua contagem de reproduções, e o objeto usage fornece esse número diretamente.
As funcionalidades de memória contam para os limites de utilização da subscrição?
Sim, indiretamente, porque os limites da subscrição são consumidos pelos tokens incluídos em cada pedido. A documentação de ajuda da Anthropic afirma que conversas mais longas que acionam a gestão automática do contexto consomem mais do limite de utilização. A memória torna cada pedido ligeiramente mais longo, e uma sessão longa repete esse comprimento em todos os turnos. Como funcionam realmente os limites de utilização do Claude explica o que é reposto e quando.