Quale modello Claude scegliere? Guida ai costi
Confronto costi Claude API luglio 2026. Analisi prezzi Opus 4.8, Sonnet 5 e Haiku 4.5 su 100.000 job per ottimizzare la spesa dei token in input e output.
Quale modello Claude dovrei usare?
La risposta breve su quale modello Claude utilizzare è: inizia con Claude Opus 4.8 e passa a un altro modello solo se hai un motivo specifico. Anche la guida di Anthropic segue questo approccio. "Se non sei sicuro di quale modello utilizzare, inizia con Claude Opus 4.8 per il coding agentico complesso e il lavoro enterprise." Passa a Claude Sonnet 5 quando il task è ben specificato e viene eseguito molte volte al giorno. Passa ulteriormente a Claude Haiku 4.5 per lavori meccanici ad alto volume dove conosci già l'output corretto. Claude Fable 5 è il modello superiore per gli agenti a lunga esecuzione.
La scelta comporta dei costi. Questi sono i prezzi della Claude API (application programming interface) aggiornati al 23 luglio 2026, per milione di token (indicati nella documentazione come MTok).
- Claude Fable 5 (
claude-fable-5): $10 / MTok in, $50 / MTok out. 1M context. - Claude Opus 4.8 (
claude-opus-4-8): $5 in, $25 out. 1M context. - Claude Opus 4.7 (
claude-opus-4-7): $5 in, $25 out. 1M context. - Claude Sonnet 5 (
claude-sonnet-5): $2 in, $10 out con prezzo introduttivo fino al 31 agosto 2026. Il prezzo standard di $3 in, $15 out entrerà in vigore il 1 settembre 2026. 1M context. - Claude Haiku 4.5 (
claude-haiku-4-5): $1 in, $5 out. 200K context.
Gli identificatori sono completi così come scritti. Non viene aggiunto alcun elemento.
La dimensione non comporta sovrapprezzi sui modelli da 1M-token: "Una richiesta da 900k-token viene fatturata con la stessa tariffa per token di una richiesta da 9k-token."
A cosa serve ogni modello
Anthropic descrive la gamma con una riga per modello; queste descrizioni sono più affidabili di qualsiasi leaderboard.
- Claude Fable 5: "Intelligenza di nuova generazione per agenti a lunga esecuzione." È il più lento dei quattro per latenza.
- Claude Opus 4.8: "Per coding agentico complesso e lavoro enterprise." Latenza moderata.
- Claude Sonnet 5: "La migliore combinazione di velocità e intelligenza." Veloce.
- Claude Haiku 4.5: "Il modello più veloce con intelligenza quasi frontier."
Haiku 4.5 presenta limiti che determinano l'idoneità per un compito prima ancora del costo. La sua context window è di 200K token invece di 1M; pertanto, un repository ampio o una lunga trascrizione di un agente non rientreranno nel limite. Il suo output massimo sulla Messages API sincrona è di 64K token, contro i 128K degli altri modelli. Il suo knowledge cutoff affidabile è febbraio 2025, mentre gli altri tre modelli arrivano a gennaio 2026.
Qual è l'impatto economico della scelta su un carico di lavoro reale?
Ogni modello della linea applica un costo per l'output pari a cinque volte il tasso dell'input. Opus 4.8 costa $5 per l'input e $25 per l'output. Haiku 4.5 costa $1 per l'input e $5 per l'output. Il rapporto rimane costante per tutta la gamma; la scelta del modello è quindi cruciale per i carichi di lavoro con un elevato volume di output.
Il lavoro agentico rientra in questa categoria, poiché i token di ragionamento vengono fatturati come token di output e contribuiscono a max_tokens anche quando il testo non viene inviato all'utente. Su Fable 5, Opus 4.8, Opus 4.7 e Sonnet 5, il riepilogo del ragionamento è omesso di default, quindi il campo thinking risulta vuoto. La fatturazione non cambia: "In ogni caso, il blocco viene fatturato e restituito allo stesso modo nelle conversazioni multi-turno." Analisi dettagliata dei costi dei token di Claude esamina approfonditamente questo meccanismo.
La presenza o l'assenza della funzione thinking varia tra i modelli confrontati; ignorare questo dettaglio comprometterà i test sui costi. Su Sonnet 5 e Fable 5 la funzione thinking è attiva di default e non richiede configurazione. Su Opus 4.8 e Opus 4.7 è disattivata, a meno che non si imposti thinking: {type: "adaptive"} nella richiesta. Assicurarsi che la configurazione sia identica su entrambi i modelli prima di analizzare i dati numerici.
Perché il modello più economico può essere il più costoso
Prendiamo un singolo task di coding. La richiesta contiene 60,000 token di contesto e il modello genera 8,000 token di output, inclusi i passaggi di thinking. Senza caching, il calcolo rimane visibile.
Su Opus 4.8: 0.06 MTok di input a $5 corrispondono a $0.30, e 0.008 MTok di output a $25 corrispondono a $0.20. Il tentativo costa $0.50. Su Haiku 4.5 lo stesso tentativo costa $0.06 più $0.04, quindi $0.10.
Haiku è cinque volte più economico per tentativo. Sembra un grande risparmio, finché non si valuta l'effetto di un tentativo fallito. Se si riceve una risposta errata, si perde tempo. Se si invia nuovamente la risposta come contesto nel tentativo successivo, ogni tentativo sarà più grande del precedente. Se al terzo tentativo l'errore persiste, si passa al modello superiore: $0.30 di Haiku più $0.50 di Opus corrispondono a $0.80, ovvero il 60% in più rispetto a un singolo utilizzo di Opus.
La domanda decisiva è quanto costa verificare la risposta. Se l'errore è evidente in un secondo, il modello piccolo è conveniente. Se per individuare l'errore è necessario analizzare un diff con attenzione, il modello piccolo comporta una perdita di tempo che non compare in fattura.
Quando un modello più piccolo è la scelta migliore
Haiku 4.5 è la soluzione corretta in questi casi:
- Operazioni meccaniche di un subagent. Un subagent che rinomina file o raccoglie l'output di una ricerca non richiede ragionamento avanzato. Questo è il pattern standard dopo aver costruito un agente AI con Claude e avergli fornito degli helper.
- Triage dei log. Determinare se una riga è rumore o se richiede l'attenzione di un umano è un giudizio limitato con modalità di errore evidenti.
- Classificazione rispetto a un set di label fisse. L'output è breve e l'accuratezza è misurabile su un campione.
- Chiamate di produzione ad alto volume. Con 100,000 esecuzioni al giorno, la differenza di costo per token non è più trascurabile. Questo è il formato tipico degli AI workflows integrati in n8n.
- Qualsiasi scenario in cui la velocità di risposta è fondamentale per l'utente. Haiku 4.5 è il modello più veloce della linea di prodotti.
Un limite riguarda specificamente Haiku. Il suo prompt minimo cacheabile è di 4,096 token, contro i 1,024 di Opus 4.8 e Sonnet 5; al di sotto di tale soglia "any requests to cache fewer than this number of tokens will be processed without caching, and no error is returned". Un blocco di istruzioni da 1,500 token che viene memorizzato nella cache su Sonnet 5, non viene memorizzato silenziosamente su Haiku 4.5. Il segnale è dato da cache_creation_input_tokens e cache_read_input_tokens entrambi a zero, fattore che riduce i costi di un agente sempre attivo insieme alle altre cause di mancata cache.
Le leve che modificano la risposta
Ognuna di queste opzioni sposta il costo finale oltre quanto determinato dal nome del modello.
Effort. output_config.effort controlla quanto lavoro esegue il modello prima di rispondere. I livelli sono low, medium, high, xhigh e max; il valore predefinito è high: "Impostare effort a high produce esattamente lo stesso comportamento che omettere completamente il parametro effort." Questo parametro è annidato all'interno di output_config invece di trovarsi al livello principale della richiesta:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)L'effort influenza ogni token nella risposta: "Può influenzare il consumo di tutti i token, incluse le tool calls. Ad esempio, un effort inferiore comporterà meno tool calls da parte di Claude." Questo effetto si accumula in un loop agentico. Non è un limite di token: "L'effort è un segnale comportamentale, non un budget rigido di token." Anthropic non pubblica un moltiplicatore di costo per ogni livello e suggerisce di testare il proprio caso d'uso; pertanto, un'esecuzione di Sonnet 5 a high rispetto a un'esecuzione di Opus 4.8 a low è un confronto reale che è possibile eseguire oggi stesso. Haiku 4.5 non è presente nell'elenco dei modelli che supportano l'effort.
Prompt caching. Una lettura da cache costa 0.1x rispetto alla tariffa base di input; il valore che determina la scelta del modello dipende da questo rapporto tra i vari tier. Una cache hit su Opus 4.8 costa $0.50 / MTok, mentre l'input non in cache su Haiku 4.5 costa $1 / MTok; quindi, un prefisso Opus con cache ottimizzata è più economico per token di input rispetto a un prompt Haiku senza cache. La gestione della sessione è più importante della scelta del modello per qualsiasi workload che invia ripetutamente un prefisso ampio e stabile.
Batches. Se non è richiesta una risposta immediata, la Message Batches API esegue gli stessi modelli con "uno sconto del 50% sia sui token di input che di output". Questo dimezza ogni riga del confronto riportato di seguito e funziona su tutti i tier: un lavoro batch su Opus 4.8 costa meno di un lavoro sincrono su Sonnet 5 al prezzo standard a partire dal 1 settembre 2026, scambiando la latenza con la capacità a parità di spesa.
Confronto dei costi per singolo task
Il carico di lavoro: classificare 100,000 email di supporto, una chiamata per email, 2,000 input token e 300 output token per chiamata. Il totale è di 200 MTok di input e 30 MTok di output.
- Haiku 4.5: 200 x $1 = $200 in, 30 x $5 = $150 out. Totale $350.
- Sonnet 5, tariffa introduttiva: 200 x $2 = $400 in, 30 x $10 = $300 out. Totale $700.
- Sonnet 5, dal 1 settembre 2026: 200 x $3 = $600 in, 30 x $15 = $450 out. Totale $1,050.
- Opus 4.8: 200 x $5 = $1,000 in, 30 x $25 = $750 out. Totale $1,750.
Modificare quattro valori per ricalcolare il costo con i prezzi futuri. Le modifiche seguenti influenzano il risultato più del nome del modello:
- Il batching dimezza ogni riga: $175, $350, $525 e $875. Non essendoci attese per un'esecuzione di classificazione notturna, non c'è motivo di evitarlo.
- Caching del prefisso condiviso. Supponiamo che 1,200 dei 2,000 input token siano lo stesso blocco di istruzioni per ogni chiamata. Su Sonnet 5 con tariffa introduttiva, il costo è di $0.20 / MTok come cache hit invece di $2 / MTok; quindi 120 MTok costano $24 invece di $240. Aggiungendo 80 MTok di input nuovi a $2 ($160) e $300 di output, il costo di Sonnet 5 scende a circa $484 invece di $700. La stessa tecnica è inutile su Haiku 4.5, poiché 1,200 token è inferiore al minimo di 4,096 token.
- Retry. Supponiamo di rifiutare la risposta di Haiku sull'8% delle email e di rieseguire tali chiamate su Opus 4.8. Aggiungendo 0.08 x $1,750 = $140 ai $350, si ottengono $490. Calcolate il vostro tasso di rifiuto invece di usare il mio.
- Definizioni degli strumenti, se il task le utilizza. Il system prompt generato è di 290 token su Opus 4.8 con
tool_choiceimpostato suauto, 354 su Sonnet 5 e 496 su Haiku 4.5. Il modello più economico presenta il maggior overhead fisso.
Haiku con un percorso di escalation a $490 e Sonnet 5 con caching a $484 hanno lo stesso costo, e uno dei due completa il lavoro in un singolo passaggio. Il modello non è mai l'unico fattore determinante.
Cambiare modello durante la sessione permette di risparmiare?
Il risparmio è inferiore a quanto indicato dai prezzi di listino, poiché il risparmio si applica per token e il rischio è la perdita dell'intero prefisso in cache.
Anthropic documenta i fattori che invalidano la cache. I prefissi sono costruiti nell'ordine tools, poi system, poi messages; "Le modifiche a ogni livello invalidano tale livello e tutti i livelli successivi". Anche due impostazioni di richiesta sono presenti in questo elenco: "La configurazione di thinking e il livello effort risolto vengono inseriti direttamente nel prompt, quindi la modifica di uno di essi avvia un nuovo prefisso di cache". La documentazione specifica inoltre: "variare l'effort tra diversi carichi di lavoro piuttosto che all'interno di una conversazione che dipende dai cache hit".
Il modello non è presente nell'elenco documentato, quindi non fare assunzioni in nessuno dei due sensi. Controlla cache_read_input_tokens alla prima richiesta dopo il cambio e verifica il valore ottenuto. Su un prefisso Opus da 150,000 token, una lettura in cache costa circa $0.08 e una nuova scrittura circa $0.94; questo costo è superiore al risparmio derivante da diversi turni basati sulla differenza per token.
Pertanto, cambia queste impostazioni tra un task e l'altro, non all'interno dello stesso. In Claude Code, questo significa prima /clear, quando la cache viene comunque eliminata, e successivamente /model o /effort.
Come testare la risposta sul proprio carico di lavoro
Non dimensionare un prompt utilizzando il conteggio ottenuto da un modello differente. L'endpoint per il conteggio dei token è gratuito e utilizza il tokenizer del modello specificato; pertanto, indica il modello che intendi chiamare. Opus 4.7 e versioni successive, Fable 5 e Sonnet 5 utilizzano un tokenizer più recente che "genera circa il 30% di token in più per lo stesso testo". Un budget calcolato su un modello precedente risulterà insufficiente su un modello recente, anche a parità di costo per token.
Analizza quindi il risultato ottenuto. input_tokens rappresenta solo la parte non memorizzata nella cache; la dimensione reale del prompt è data da quel campo più cache_creation_input_tokens più cache_read_input_tokens. Una prima app Claude API su un VPS è il metodo più semplice per eseguire tale misurazione, mentre quale piano Claude si adatta al tuo utilizzo è una decisione separata relativa alla modalità di pagamento per token.
FAQ
Quale modello Claude è il migliore per il coding?
Claude Opus 4.8 è il punto di partenza documentato per il coding agentico complesso, con un costo di $5 per milione di input token e $25 per milione di output a partire da luglio 2026. Claude Sonnet 5 è posizionato come la migliore combinazione di velocità e intelligenza; con un costo di $2 / $10 fino al 31 agosto 2026, costa meno della metà. Esegui lo stesso task su entrambi, mantieni costante la configurazione di thinking e confronta la spesa totale di token da response.usage.
Claude Haiku 4.5 è abbastanza economico da sostituire Sonnet 5?
Per token, facilmente: $1 / $5 contro $2 / $10 per Sonnet 5 con il pricing introduttivo, o $3 / $15 dal 1 settembre 2026. I limiti determinano la scelta. Haiku 4.5 ha una finestra di contesto da 200K token invece di 1M, un output massimo di 64K sulla Messages API sincrona, un cutoff di conoscenza affidabile a febbraio 2025, nessun supporto output_config.effort e un prompt minimo di 4,096 token per la cache che disabilita la cache sui system prompt brevi.
Passare a un modello Claude più economico a metà sessione fa risparmiare?
Meno spesso di quanto sembri. Anthropic documenta gli invalidatori della cache come modifiche al prefisso tools, system o messages, modifiche alla configurazione di thinking e modifiche a output_config.effort. L'effetto di un cambio di modello su una cache esistente non è documentato; consideralo ignoto e leggi cache_read_input_tokens alla prima richiesta successiva. Il risparmio è rilevante: su un prefisso Opus 4.8 da 150,000 token, una lettura della cache costa circa $0.08 e una nuova scrittura circa $0.94, il che annulla il risparmio ottenuto in diversi turni tramite il costo per token. Passa tra i task, dopo /clear in Claude Code, quando la cache viene comunque eliminata.
Cosa fa output_config.effort sulla mia fattura?
Modifica il numero di token che il modello consuma tra testo, tool calls e thinking. Un effort inferiore genera meno tool calls, il che aumenta i costi nei loop agentici perché ogni risultato del tool viene rispedito nei turni successivi. I livelli sono low, medium, high, xhigh e max, con high come default. Anthropic non pubblica un moltiplicatore di costo per livello, definendo l'effort come un segnale comportamentale piuttosto che un budget di token; misuralo sul proprio task.
Quanto fa risparmiare la Claude Batches API?
Il 50% sia sui token di input che di output, in cambio di una consegna asincrona. A luglio 2026, questo porta Opus 4.8 a $2.50 in / $12.50 out, Sonnet 5 a $1 / $5 con il pricing introduttivo e Haiku 4.5 a $0.50 / $2.50. Il confronto rilevante avviene tra i tier: un job Opus 4.8 in batch costa meno di un job Sonnet 5 sincrono alla tariffa standard dal 1 settembre 2026; quindi il batching permette di utilizzare un modello più potente con la stessa cifra.