La memoria di Claude costa di più? Prezzi e token
Anthropic non applica un prezzo ai token di memoria: il testo ricordato conta come input, quindi il costo dipende da quanto viene reinviato e dal caching.
Le funzionalità di memoria di Claude hanno un costo aggiuntivo?
Le funzionalità di memoria di Claude non hanno un prezzo separato. Le tariffe pubblicate da Anthropic sono calcolate per milione di token di input e per milione di token di output, con tariffe aggiuntive per il prompt caching; nessuna di queste è denominata token di memoria. L'archiviazione della memoria non ha costi sull'API Claude (application programming interface), perché lo strumento di memoria viene eseguito lato client e il file risiede su uno storage di tua proprietà.
La memoria incide comunque sulla fattura, perché un'informazione memorizzata modifica una risposta solo quando viene inclusa nella richiesta letta da Claude. Ricordare significa inviare nuovamente il contenuto. Il testo arriva come token di input e viene addebitato alla normale tariffa di input del modello. L'importo dipende da due fattori: il numero di token del testo memorizzato reinviati a ogni turno e la possibilità di servire quel testo dal prompt cache.
Con un abbonamento Pro o Max non paghi affatto in base ai token, quindi la memoria consuma il tuo limite di utilizzo anziché il tuo denaro. Il meccanismo descritto di seguito è identico. Cambia soltanto l'unità di misura. Il limite è finito, quindi prima di decidere quanta memoria includere in ogni turno conviene sapere quanto costa Claude Pro e quando i suoi limiti diventano vincolanti. Claude Enterprise funziona ancora diversamente, perché conteggia ogni token alle tariffe API oltre al prezzo della licenza, quindi un blocco di memoria troppo grande si traduce nuovamente in un costo anziché in consumo del limite. Se ridurre la memoria riporta comodamente il tuo utilizzo sotto il limite di un piano più economico, passare da Max a Pro è il passo successivo da valutare; il cambio diventa effettivo alla fine del periodo già pagato. Se il confronto che stai valutando riguarda provider diversi e non i piani di Anthropic, confrontare i piani di Claude con quelli di ChatGPT ai prezzi attuali è il punto di partenza.
Che cosa significa “memoria” nelle diverse superfici Claude
Tre prodotti distinti usano la stessa parola. Confonderli è il motivo principale per cui questa domanda risulta poco chiara.
Lo strumento di memoria nelle Claude API. Aggiungi una voce all’array tools e implementi le operazioni sui file nel tuo codice.
{"type": "memory_20250818", "name": "memory"}Ad agosto 2026 questo strumento è generalmente disponibile nella Messages API senza un’intestazione beta, sui modelli Claude 4 e successivi. È gestito lato client: Claude richiede un’operazione come view /memories, il tuo gestore la esegue sullo storage sotto il tuo controllo e restituisce il risultato in un blocco tool_result. Anthropic non conserva il file, quindi non devi trasferire alcun costo di storage. Paghi invece il round trip. La definizione dello strumento viene inviata in ogni richiesta e il contenuto del file restituito rimane nella conversazione da quel momento in poi.
Anthropic pubblica la parte fissa di questo overhead. Su Claude Opus 5, con una scelta dello strumento pari a auto, il prompt di sistema per l'uso dello strumento è di 286 token, come documentato ad agosto 2026. Questo costo viene applicato una volta per richiesta quando è presente un qualsiasi strumento, indipendentemente dal fatto che sia lo strumento di memoria.
Claude Code. All'inizio di ogni sessione vengono caricati due meccanismi. I file CLAUDE.md contengono le istruzioni che scrivi. La memoria automatica contiene le note che Claude scrive per sé, in ~/.claude/projects/<project>/memory/. Vengono caricati solo le prime 200 righe o i primi 25KB di MEMORY.md, a seconda di quale limite viene raggiunto per primo. I file degli argomenti accanto a questo file vengono letti su richiesta, non all'avvio. Tutto ciò che viene caricato all'avvio entra nel prefisso che ogni richiesta successiva della sessione trasmette. Come Claude Code recupera la memoria tra le sessioni descrive l'ordine di caricamento, file per file.
Claude sul Web. Su claude.ai, la memoria è un insieme di voci che Claude scrive e aggiorna durante la conversazione, con uno spazio di memoria separato per ogni progetto. Impostazioni > Memoria mostra ciò che è archiviato, mentre l'interruttore consente di scegliere Sospendi memoria o Reimposta memoria. Questa superficie viene fatturata tramite abbonamento, quindi la memoria utilizza i limiti di utilizzo.
Perché il testo memorizzato viene fatturato come token di input
La Messages API è stateless. Non conserva nulla tra una chiamata e l'altra, quindi il client invia l'intera conversazione a ogni turno e il modello la legge nuovamente per intero. La memoria non fa eccezione. È un altro blocco di testo nella stessa richiesta.
La suddivisione è visibile nell'oggetto usage di qualsiasi risposta.
"usage": {
"input_tokens": 412,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 18240,
"output_tokens": 236
}input_tokens conta soltanto i token che non sono stati né letti dalla cache né utilizzati per crearla; in pratica, sono i token successivi all'ultimo punto di cache. L'input totale della richiesta è cache_read_input_tokens più cache_creation_input_tokens più input_tokens. Un file di memoria aperto da Claude tre turni prima rientra in questo totale a ogni turno successivo. Viene conteggiato in cache_read_input_tokens finché il prefisso memorizzato nella cache resta valido e in input_tokens quando non lo è. Lo stesso testo può quindi avere due prezzi molto diversi. I token di input e di output hanno prezzi diversi, e la memoria viene sempre conteggiata come input.
Dove vedere questi numeri nel tuo utilizzo
Non prendere un dato da un post di blog, incluso questo. Misura il tuo blocco di memoria. Il conteggio dei token è gratuito e ha un proprio limite di frequenza, quindi la misurazione non costa nulla.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{"role": "user", "content": "Hello, Claude"}]
}'La risposta è un unico numero, ad esempio { "input_tokens": 14 }. Esegui il comando una volta incollando il testo della memoria nel campo system e una volta senza quel testo. La differenza corrisponde al costo di quella memoria a ogni turno. Sono necessarie due precisazioni. Il conteggio è una stima e i token aggiuntivi che Anthropic inserisce per le proprie ottimizzazioni di sistema non ti vengono addebitati. Esegui inoltre il conteggio con il modello che userai realmente, perché Claude 4.7 e le versioni successive utilizzano un tokenizer più recente che produce circa il 30 percento di token in più per lo stesso testo.
In Claude Code puoi ottenere la stessa informazione senza usare alcun comando curl.
/contextmostra ciò che è caricato in questo momento, inclusi i file di memoria, così puoi vedere la quota che occupano nella finestra prima di digitare qualsiasi cosa./memoryelenca i fileCLAUDE.mde apre la directory della memoria automatica./usagestampa i totali della sessione, inclusi i letture dalla cache e le scritture nella cache.- La riga di stato può visualizzare continuamente l'utilizzo della finestra di contesto, così puoi vedere la crescita mentre avviene.
Il blocco della sessione /usage è simile al seguente:
Total cost: $0.55
Total duration (API): 6m 20s
Total duration (wall): 6h 33m 10s
Total code changes: 0 lines added, 0 lines removed
Usage by model:
claude-sonnet-4-6: 1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)Leggi attentamente l'ultima riga. Il valore di 940.0k per le letture dalla cache rappresenta la conversazione completa, inclusa la memoria, che viene inviata nuovamente a ogni turno alla tariffa della cache. Il valore di 1.2k per l'input rappresenta soltanto la parte nuova. Claude Code calcola localmente questo importo in dollari a partire dai prezzi di listino, quindi non considera eventuali sconti applicati al tuo account e può differire da quello riportato in fattura. La pagina Usage nella Claude Console contiene il valore ufficiale.
Esegui quindi direttamente il confronto. Poni la stessa domanda iniziale in due sessioni nuove: una normale e una con la memoria automatica disattivata.
CLAUDE_CODE_DISABLE_AUTO_MEMORY=1 claudeEsegui /context in entrambe e confronta la voce dei file di memoria. La differenza corrisponde al costo della memoria accumulata all'avvio di ogni sessione, prima che venga eseguita qualsiasi attività. Una panoramica completa della destinazione dell'utilizzo dei token di Claude Code è una lettura utile da affiancare a questi due numeri.
Quanto costa riprodurre la memoria per milione di token?
Il prompt caching spiega perché lo stesso blocco di memoria può costare dieci volte di più in un turno rispetto a un altro. Anthropic pubblica le tariffe della cache come multipli del prezzo base dell'input di ciascun modello, quindi il rapporto resta valido anche quando cambiano i prezzi in dollari.
The data behind this chart
[
{
"label": "Base input",
"price_multiple": 1
},
{
"label": "5 minute cache write",
"price_multiple": 1.25
},
{
"label": "1 hour cache write",
"price_multiple": 2
},
{
"label": "Cache read",
"price_multiple": 0.1
}
]La lettura dalla cache costa 0.1 volte il prezzo base dell'input. La scrittura di una voce con durata di 5 minuti costa 1.25 volte il prezzo base, mentre la durata di 1 ora costa 2 volte il prezzo base. Anthropic indica chiaramente il punto di pareggio: il caching conviene dopo una lettura dalla cache con durata di 5 minuti, oppure dopo due letture dalla cache con durata di 1 ora. Il punto di pareggio del prompt caching è il calcolo da eseguire prima di decidere dove collocare la memoria.
Questi multipli trasformano il numero di riproduzioni in un calcolo aritmetico. Il blocco seguente usa i multipli pubblicati sopra e non misura alcun carico di lavoro reale. Calcola il costo di un blocco di memoria in tre modi su una sessione di 100 turni, espresso come numero equivalente di token addebitati alla normale tariffa base dell'input.
The data behind this chart
[
{
"label": "4,000 tokens, never cached",
"base_rate_equivalent_tokens": "400,000"
},
{
"label": "4,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "44,600"
},
{
"label": "1,000 tokens, 1 write and 99 reads",
"base_rate_equivalent_tokens": "11,150"
}
]Un blocco di memoria da 4,000 token che non viene trovato nella cache in tutti i 100 turni viene addebitato come 400,000 token alla tariffa base. Lo stesso blocco, con una scrittura nella cache di 5 minuti e 99 letture dalla cache, viene addebitato come 44,600. Se lo si riduce a un quarto delle dimensioni e si mantiene il caching, viene addebitato come 11,150. La funzionalità non è cambiata nelle 3 righe. È cambiato soltanto il comportamento delle riproduzioni. Si tratta ancora di conteggi di token, non di importi in denaro, e convertire un conteggio di token in un importo della fattura mensile richiede una moltiplicazione per la tariffa del modello per milione di token. Questa tariffa dipende dal modello utilizzato; quindi, se l'agente verrà eseguito su Claude Fable 5, si parte da le tariffe pubblicate per milione di token e dai carichi di lavoro più adatti. Se il provider è ancora da scegliere e non è già stato deciso soltanto il modello, lo stesso lavoro calcolato sull'API di Claude e su ChatGPT mostra dove questa moltiplicazione produce risultati diversi, mentre un agente che usa molta memoria dipende fortemente dal costo dell'input.
La seconda riga presuppone che ciascuna delle 99 richieste successive arrivi mentre la voce nella cache è ancora valida. È proprio questa ipotesi a causare la maggior parte degli errori nei costi effettivi.
Perché la stessa domanda costa di più dopo una pausa?
Una voce della cache ha una durata e il conteggio parte dalla richiesta che la scrive o la legge. Il valore predefinito è di 5 minuti. L'opzione da 1 ora costa il doppio della scrittura indicata sopra. In Claude Code, la durata è di un'ora con un abbonamento e scende a 5 minuti quando si utilizzano crediti a consumo; con una chiave API o un provider cloud, il valore predefinito è di 5 minuti. L'impostazione ENABLE_PROMPT_CACHING_1H=1 mantiene la durata di un'ora quando si utilizzano crediti a consumo.
Una domanda di una sola riga digitata in una sessione lasciata aperta durante la pausa pranzo può quindi costare molto, perché la voce della cache è scaduta mentre eri assente. L'intero prefisso, memoria inclusa, viene elaborato di nuovo alla tariffa base per gli input e scritto nuovamente nella cache. È stata la durata della pausa a determinare quel costo.
Puoi verificarlo invece di limitarti a fidarti. Nei piani Pro, Max, Team o Enterprise, il dettaglio /usage segnala qualsiasi comportamento responsabile di almeno il 10 percento dell'utilizzo recente; tra le voci compaiono esplicitamente sia i contesti lunghi sia i cache miss. Con l'API, osserva cache_creation_input_tokens: dopo un periodo di inattività torna a indicare la dimensione completa del prefisso nella prima richiesta.
Cosa invalida silenziosamente la cache
Il prefisso memorizzato nella cache è ordinato: prima gli strumenti, poi il sistema e infine i messaggi. Una modifica a un livello invalida quel livello e tutti quelli successivi. La modifica della definizione di uno strumento elimina l'intera cache. La modifica del prompt di sistema elimina la cache del sistema e dei messaggi.
Questa è la trappola per chi conserva la memoria nel prompt di sistema e lo riscrive man mano che l'agente apprende. Ogni riscrittura elimina la copia memorizzata nella cache di tutto ciò che segue, quindi la richiesta successiva deve riscrivere nuovamente l'intero contenuto. Mantieni il materiale stabile all'inizio e non modificarlo. Inserisci invece il materiale variabile nella parte finale dell'elenco dei messaggi, dove la sua invalidazione ha un costo ridotto.
Esiste un secondo problema, meno evidente. Ogni modello ha un prefisso minimo memorizzabile nella cache: 512 token su Claude Opus 5, 1,024 su Claude Sonnet 5 e 4,096 su Claude Haiku 4.5, secondo quanto pubblicato ad agosto 2026. La documentazione di Anthropic descrive esplicitamente cosa accade al di sotto di questa soglia: "Le richieste che tentano di memorizzare nella cache un numero di token inferiore a questo valore vengono elaborate senza caching e non viene restituito alcun errore." Di conseguenza, un file di memoria di piccole dimensioni contrassegnato con cache_control non produce alcun effetto, senza segnalazioni. Il sintomo osservabile è cache_creation_input_tokens che rimane a 0, anche se il prompt contiene chiaramente un punto di interruzione.
Elimina la memoria che non è più utile
Ogni riga di memoria consuma token a ogni turno che la include. Perciò, per ogni riga, chiediti se ha modificato di recente una risposta. Claude Code rende concreti questi limiti. Cerca di mantenere un file CLAUDE.md con meno di 200 righe, perché i file più lunghi consumano più contesto e riducono l’affidabilità con cui Claude segue le istruzioni. MEMORY.md è limitato alle prime 200 righe o a 25KB al caricamento. Tutto ciò che supera questo limite viene escluso all’avvio della sessione successiva. Un indice sovradimensionato consuma quindi token senza aggiungere informazioni utili.
Due abitudini aiutano a mantenerlo breve. Sposta i dettagli dall’indice ai file degli argomenti. Claude li legge su richiesta invece che all’avvio. Sposta le istruzioni del flusso di lavoro da CLAUDE.md alle skill, che vengono caricate solo quando vengono invocate. Per i file di memoria che iniziano già con il frontmatter, Claude Code registra l’ora di scrittura nel campo modified come timestamp ISO 8601, a partire dalla versione 2.1.214. Questo timestamp è il modo più rapido per individuare un’informazione diventata obsoleta. Eliminare la memoria obsoleta descrive più dettagliatamente il processo di revisione.
Quando il recupero dei dati è preferibile al caricamento completo nel contesto
Lo strumento di memoria serve per recuperare i dati quando servono. Invece di caricare tutto in anticipo, l'agente registra ciò che apprende e legge un file solo quando l'attività lo richiede. Questo cambia il calcolo, perché la lettura di un file costa i relativi token una sola volta e poi resta nel prefisso memorizzato nella cache, mentre un blocco caricato permanentemente ha un costo a ogni turno.
Dai due grafici precedenti deriva una regola semplice. Il testo utilizzato in quasi ogni turno appartiene al prefisso stabile memorizzato nella cache. Il testo utilizzato una volta ogni venti turni dovrebbe essere gestito tramite una chiamata view. Il punto di pareggio dipende dal numero di riproduzioni, non da ciò che addebita Anthropic.
Tramite l'API puoi anche consentire alla piattaforma di ridurre la conversazione. La modifica del contesto elimina i risultati meno recenti degli strumenti quando la conversazione supera una soglia configurata.
{
"edits": [
{
"type": "clear_tool_uses_20250919",
"trigger": {"type": "input_tokens", "value": 30000},
"keep": {"type": "tool_uses", "value": 3},
"clear_at_least": {"type": "input_tokens", "value": 5000}
}
]
}I valori predefiniti prevedono una soglia di 100,000 token di input e la conservazione di 3 utilizzi degli strumenti. Prima di abilitarla, leggi il comportamento dell'interazione con la memorizzazione nella cache: eliminare il contenuto invalida il prefisso memorizzato nella cache dal punto in cui viene eseguita l'eliminazione, quindi la richiesta successiva comporta una scrittura nella cache. A questo serve clear_at_least. Ritarda l'eliminazione finché il risparmio non è sufficiente a giustificare la scrittura. La risposta indica esattamente ciò che è avvenuto tramite context_management, con cleared_tool_uses e cleared_input_tokens, rendendo misurabile il compromesso anziché lasciarlo sul piano teorico. Gestione della finestra di contesto in Claude Code applica la stessa idea a una sessione di sviluppo.
Cosa ha una voce di costo propria
La memoria non ha un costo separato, ma alcune funzionalità lo hanno effettivamente e conviene sapere quali. Queste sono le tariffe pubblicate per l'API di Claude ad agosto 2026. Alcune operazioni non costano nulla, ma l'API di Claude non prevede un piano gratuito, solo un piccolo credito alla registrazione; pertanto, tutto ciò che segue genera spesa effettiva fin dalla prima richiesta.
- Ricerca web: $10 ogni 1.000 ricerche, oltre al normale costo dei token per tutto il contenuto che la ricerca inserisce nel contesto.
- Esecuzione del codice: 1.550 ore gratuite per organizzazione ogni mese, poi $0.05 per ora e per container. È gratuita quando viene usata insieme alla ricerca web o al recupero di contenuti web.
- Claude Managed Agents: durata della sessione a $0.08 per ora-sessione, oltre ai normali costi dei token.
- Recupero di contenuti web: nessun costo aggiuntivo, solo il costo dei token del contenuto recuperato.
La memoria non compare in nessuna di queste voci. Compare nel conteggio dei token di input, che è esattamente il punto in cui puoi misurarla e in cui il pruning e il caching possono ridurla. Se stai definendo il budget per un agente che opera senza supervisione su un virtual private server (VPS), i controlli dei costi per un agente AI su un VPS sono il passaggio successivo da configurare, perché un agente con un file di memoria in crescita e senza pruning diventa ogni settimana più costoso senza che nessun sistema lo segnali.
FAQ
Le funzionalità di memoria di Claude prevedono un costo separato?
No. Il listino di Anthropic indica tariffe per milione di token di input, per milione di token di output e i moltiplicatori del prompt caching, senza una voce dedicata alla memoria. Nell'API di Claude, lo strumento di memoria è gestito lato client, quindi i file risiedono su uno storage che già paghi. La memoria aggiunge token di input, addebitati alla normale tariffa di input del modello a ogni turno che li include.
Disattivare la memoria rende Claude più economico?
Riduce il numero di token di ogni richiesta e quindi il costo della singola richiesta. Il risparmio complessivo dipende da ciò che accade dopo. Se Claude deve rileggere tre file e farti due domande per ricostruire le informazioni già presenti nella memoria, quei token costano più della memoria. Misura il risultato invece di fare supposizioni: esegui /context in una sessione con la memoria automatica attiva e in una avviata con CLAUDE_CODE_DISABLE_AUTO_MEMORY=1, quindi confronta il totale dei token utilizzati per la stessa attività.
Perché il mio utilizzo è aumentato anche se non ho modificato nulla?
La causa più comune è un cache miss dopo una pausa. Per impostazione predefinita, le voci della cache restano valide 5 minuti, oppure un'ora con l'impostazione estesa. Di conseguenza, la prima richiesta dopo una pausa rielabora l'intero prefisso alla tariffa base dei token di input e lo scrive nuovamente nella cache. La seconda causa più comune è una modifica al prefisso: cambiare la definizione di uno strumento invalida l'intera cache, mentre cambiare il system prompt invalida la cache del sistema e dei messaggi. Nei piani in abbonamento, il dettaglio /usage identifica questo comportamento quando rappresenta almeno il 10 percento dell'utilizzo recente.
La memoria dovrebbe risiedere nel system prompt o essere richiamata tramite uno strumento?
Inseriscila nel system prompt quando viene utilizzata in quasi tutti i turni, perché in questo modo resta nel prefisso memorizzato nella cache e viene addebitata alla tariffa di lettura della cache. Richiamala tramite una chiamata view quando è necessaria solo per alcune attività, perché un file letto una sola volta addebita i relativi token una sola volta, invece che a ogni turno. Il valore decisivo è il numero di riproduzioni del contesto; l'oggetto usage fornisce direttamente questo valore.
Le funzionalità di memoria vengono conteggiate nei limiti di utilizzo dell'abbonamento?
Sì, indirettamente, perché i limiti dell'abbonamento vengono consumati dai token inclusi in ogni richiesta. La documentazione di assistenza di Anthropic specifica che le conversazioni più lunghe, che attivano la gestione automatica del contesto, consumano una parte maggiore del limite di utilizzo. La memoria rende ogni richiesta leggermente più lunga e una sessione estesa ripete questa lunghezza a ogni turno. Come funzionano realmente i limiti di utilizzo di Claude spiega cosa viene azzerato e quando.