Claude Fable 5: prezzo e quando usarlo
Claude Fable 5 costa $10 per milione di token in input e $50 in output. Scopri cosa significano le tariffe pubblicate per le attività che esegui davvero.
Quanto costa Claude Fable 5?
Claude Fable 5 costa $10 per milione di token di input e $50 per milione di token di output tramite Claude API. Sono le tariffe pubblicate da Anthropic, rilevate nella pagina dei prezzi il 3 agosto 2026. L'ID del modello API è claude-fable-5. Il modello è diventato generalmente disponibile il 9 giugno 2026 tramite Claude API, Amazon Bedrock, Claude Platform on AWS, Google Cloud e Microsoft Foundry.
The data behind this chart
[
{
"label": "Claude Fable 5",
"input": "10",
"output": "50",
"cache_read": "1",
"batch_input": "5",
"batch_output": "25"
},
{
"label": "Claude Opus 5",
"input": "5",
"output": "25",
"cache_read": "0.50",
"batch_input": "2.50",
"batch_output": "12.50"
},
{
"label": "Claude Sonnet 5 (intro rate)",
"input": "2",
"output": "10",
"cache_read": "0.20",
"batch_input": "1",
"batch_output": "5"
},
{
"label": "Claude Sonnet 5 (from 1 Sep)",
"input": "3",
"output": "15",
"cache_read": "0.30",
"batch_input": "1.50",
"batch_output": "7.50"
},
{
"label": "Claude Haiku 4.5",
"input": "1",
"output": "5",
"cache_read": "0.10",
"batch_input": "0.50",
"batch_output": "2.50"
}
]Considerate questi prezzi come una scala. Fable 5 costa il doppio di Claude Opus 5, cinque volte la tariffa attuale di Claude Sonnet 5 e dieci volte quella di Claude Haiku 4.5. Il rapporto è uguale per input e output, perché ogni modello nella tabella applica all'output una tariffa esattamente cinque volte superiore alla propria tariffa di input. Quindi, se conoscete la suddivisione tra token di input e di output di un'attività, potete convertire un prezzo in un altro tramite una moltiplicazione.
Una data modifica il calcolo. Fino al 31 agosto 2026, Sonnet 5 applica una tariffa introduttiva di $2 e $10 per milione di token. Dal 1 settembre 2026, il prezzo sarà $3 e $15. Il prezzo di Fable 5 non cambia, quindi da quella data il divario tra i due modelli si riduce da cinque volte a poco più di tre volte. Se state preparando un budget per l'autunno, utilizzate i valori successivi di Sonnet.
Gli sconti e l'unico moltiplicatore che aumenta il costo
Il caching dei prompt è la leva principale. Una lettura dalla cache costa un decimo del prezzo base dell'input, cioè $1 per milione di token su Fable 5. La scrittura nella cache costa più di un normale token di input: 1.25 volte il prezzo base per la cache di cinque minuti e 2 volte il prezzo base per quella di un'ora. Una cache di cinque minuti si ripaga dopo una sola lettura, mentre una cache di un'ora si ripaga dopo due letture. Questo calcolo è il motivo per cui conviene calcolare il punto di pareggio del caching dei prompt prima di abilitarlo ovunque.
La Batch API applica uno sconto del 50% a entrambi i lati, quindi i lavori Fable 5 elaborati in batch costano $5 per i token di input e $25 per i token di output, per milione di token. Le richieste batch sono asincrone, quindi questa opzione è utile solo per i lavori che non richiedono una risposta immediata. I due sconti sono cumulabili, rendendo economico su entrambi i fronti un lavoro sottoposto a caching ed elaborato in batch.
La finestra di contesto da 1M di token è inclusa nelle tariffe standard per Claude 4.6 e i modelli successivi. Non viene applicato alcun sovrapprezzo per il contesto esteso, quindi una richiesta da 900k token viene fatturata con la stessa tariffa per token di una richiesta da 9k token.
Il moltiplicatore che aumenta il costo è la residenza dei dati. Impostando inference_geo: "us" per mantenere l'inferenza negli Stati Uniti si applica un moltiplicatore di 1.1 a ogni categoria di token, incluse le letture e le scritture nella cache. Mantieni il routing globale predefinito, salvo quando un contratto richiede diversamente.
Una regola di fatturazione è specifica per questo modello. Fable 5 include classificatori di sicurezza che possono rifiutare una richiesta. In questo caso, la Messages API restituisce stop_reason: "refusal" con una risposta HTTP 200 corretta invece di un errore e non viene addebitato alcun costo per una richiesta rifiutata prima della generazione dell'output. Se riprovi lo stesso prompt su un altro modello Claude, il credito di fallback rimborsa il costo della cache del prompt dovuto al passaggio, quindi non paghi per riscaldare due volte la stessa cache.
Quali piani includono Claude Fable 5?
Al 3 agosto 2026, la pagina di Anthropic dedicata a Claude Fable indica che il modello è disponibile per gli utenti Pro, Max, Team ed Enterprise. Il piano gratuito non è menzionato. Per gli sviluppatori, il modello è generalmente disponibile tramite Claude API e attraverso i marketplace cloud elencati sopra.
La disponibilità in un piano non significa che il modello sia incluso senza limiti. La tabella di confronto dei piani nella pagina dei prezzi di Anthropic limita Fable a una quota dei limiti di utilizzo settimanali per alcuni tipi di account e lo vincola ai crediti di utilizzo per altri. Questa configurazione è cambiata più volte nel corso di luglio 2026. Nella dichiarazione di Anthropic sul nuovo deployment di Fable 5, il modello era incluso fino al 50% dei limiti di utilizzo settimanali fino al 7 luglio 2026 nei piani Pro, Max, Team e in alcuni piani Enterprise, con l'applicazione dei crediti di utilizzo dopo tale data. Le informazioni pubblicate nel resto di luglio hanno descritto ulteriori estensioni e una distinzione tra i diversi tipi di account.
Per questo motivo, questa pagina non riporta un limite specifico per ogni piano. Nessun valore pubblicato durante quel mese è rimasto valido per due settimane, e riportare qui un numero non aggiornato sarebbe peggio che non riportarne alcuno. Apri la riga denominata Fable nella tabella di confronto dei piani il giorno in cui devi decidere e considera non aggiornato qualsiasi numero riportato in un articolo di cronaca.
La tariffa API è invece stabile. Su ogni endpoint, una volta esaurita la quantità inclusa, l'utilizzo aggiuntivo di Fable 5 viene addebitato ai prezzi riportati nel grafico precedente. Di conseguenza, il listino prezzi è il riferimento da usare per la pianificazione in entrambi i casi. È la stessa conclusione a cui si arriva quando si confronta la fatturazione API con un abbonamento per qualsiasi altro modello Claude. Se non hai ancora scelto un livello, parti da quale piano Claude corrisponde al tuo utilizzo.
Perché il conto è più alto di quanto suggerisca il rapporto tra i prezzi
Due meccanismi documentati fanno sì che Fable 5 costi più di quanto implichi un semplice confronto dei prezzi.
Il primo è il tokenizer. Fable 5 usa il tokenizer introdotto con Claude Opus 4.7. Rispetto ai modelli rilasciati prima di Opus 4.7, lo stesso testo produce circa il 30% di token in più, e l'aumento esatto dipende dal contenuto. Haiku 4.5 è precedente a quel tokenizer, quindi il divario di dieci volte riportato nel listino diventa più vicino a tredici volte quando si fornisce a entrambi i modelli lo stesso blocco di testo. Sonnet 5 usa il tokenizer più recente, quindi il confronto tra Fable e Sonnet è corretto in termini di costo per token. Il confronto tra Fable e Haiku non lo è.
Il secondo è il thinking. Il thinking adattivo è sempre attivo in Fable 5 e thinking: {"type": "disabled"} non è supportato. I token di thinking vengono fatturati come token di output, alla tariffa completa dell'output. Il chain of thought grezzo non viene mai restituito da questo modello e thinking.display è impostato per impostazione predefinita su "omitted". Di conseguenza, una risposta visibile breve può corrispondere a un numero elevato di token di output fatturati. La documentazione di Anthropic lo dichiara chiaramente: il numero di token di output fatturati non corrisponde al numero di token visibili nella risposta.
Leggere il dettaglio evita di procedere per ipotesi. Il campo usage.output_tokens_details.thinking_tokens indica quanti token di output fatturati sono stati utilizzati per il ragionamento:
{
"usage": {
"input_tokens": 25,
"output_tokens": 348,
"output_tokens_details": {
"thinking_tokens": 312
}
}
}Nell'esempio, tratto dalla documentazione di Anthropic sul thinking, 312 dei 348 token di output fatturati erano destinati al ragionamento e non sono mai stati mostrati. Durante lo streaming, questo dettaglio arriva solo nell'evento message_delta finale. Un client che smette di leggere dopo l'ultimo blocco di testo non lo registrerà mai.
Il controllo è effort, impostato su output_config.effort, con i livelli low, medium, high (il valore predefinito), xhigh e max.
{
"model": "claude-fable-5",
"max_tokens": 32000,
"output_config": { "effort": "medium" },
"messages": [{ "role": "user", "content": "..." }]
}Per questo modello, Anthropic consiglia di iniziare con high, passare a xhigh solo per le attività più sensibili alle capacità del modello e scendere a medium o low per le attività di routine. Il motivo è che, in Fable 5, un effort inferiore spesso offre risultati migliori di xhigh sui modelli precedenti. Sono presenti due problemi ricorrenti. La modifica dell'effort tra una richiesta e l'altra invalida la prompt cache, perché il valore effettivo dell'effort viene inserito nel prompt. È quindi necessario scegliere un livello per ogni carico di lavoro e mantenerlo costante. Inoltre, max_tokens è un limite rigido sull'output totale, che comprende thinking e testo della risposta. Un limite dimensionato per una risposta senza thinking può quindi causare un troncamento. La presenza di stop_reason: "max_tokens" indica che è necessario aumentare il limite oppure ridurre l'effort.
Costo per attività completata, non costo per token
The data behind this chart
[
{
"label": "Short answer (5k in, 1k out)",
"fable_5": "0.10",
"opus_5": "0.05",
"sonnet_5": "0.02",
"haiku_4_5": "0.01"
},
{
"label": "Coding session (300k in, 40k out)",
"fable_5": "5.00",
"opus_5": "2.50",
"sonnet_5": "1.00",
"haiku_4_5": "0.50"
},
{
"label": "Long agent run (2M in, 400k out)",
"fable_5": "40.00",
"opus_5": "20.00",
"sonnet_5": "8.00",
"haiku_4_5": "4.00"
}
]Quelle 3 righe sono calcoli aritmetici, non un benchmark. Le tariffe sono pubblicate. I volumi di token sono ipotesi da sostituire con i dati del proprio utilizzo. Una sessione di coding simile a quella della riga centrale costa $5.00 con Fable 5, contro $1.00 con Sonnet 5. L'esecuzione lunga costa $40.00 contro $8.00. Il valore della colonna Haiku nell'ultima riga è solo aritmetico: Haiku 4.5 ha una finestra di contesto di 200k token, quindi non può contenere affatto quel lavoro.
Il costo per token è l'unità di misura sbagliata per prendere una decisione. Il costo per attività completata è il costo per tentativo moltiplicato per il numero di tentativi. Alle tariffe attuali, un tentativo con Fable 5 costa quanto cinque tentativi con Sonnet 5, quindi il solo numero di retry giustifica quasi mai l'upgrade. Sonnet dovrebbe fallire più di quattro volte su cinque prima che il percorso meno costoso risulti sfavorevole in termini di token.
A giustificare la scelta sono invece tutti gli elementi che la fattura dei token non include. Nella maggior parte dei mercati, la differenza tra le due esecuzioni lunghe nel grafico è inferiore al costo di un'ora di lavoro di un engineer. Se il modello più costoso fa risparmiare un'ora di revisione o evita una migrazione errata che sarebbe poi necessario annullare, si è già ripagato, anche se la fattura non mostra questo risparmio. Confrontate i costi in denaro per risultato accettato e includete nel totale anche il vostro tempo. Capire quanto acquistano davvero un milione di token rende questa stima molto meno astratta.
Tre attività in cui Claude Fable 5 giustifica il prezzo
Esecuzioni agentiche di lunga durata, in cui una scelta errata è costosa. Fable 5 è progettato per attività che si misurano in ore: una finestra di contesto da 1M token, fino a 128k token di output per richiesta e un livello di impegno xhigh pensato per attività che durano più di trenta minuti, con budget di token nell’ordine dei milioni. Confrontate il costo dell’esecuzione con quello della correzione necessaria se un agente imbocca un ramo errato al passaggio 40 e nessuno se ne accorge prima del passaggio 300.
Una migrazione o un audit eseguito una sola volta su una codebase di grandi dimensioni. Un’attività una tantum non consente di distribuire il costo su un volume elevato, quindi il sovrapprezzo per token ricade su un’unica fattura e l’intero lavoro può rientrare in una sola finestra di contesto. Se può essere eseguito in modo asincrono, la Batch API dimezza il costo a $25 per milione di token di output.
L’attività che un modello più economico ha già fallito due volte. Due tentativi falliti, più il tempo dedicato al debugging, costano più di un tentativo con Fable ai volumi indicati nel grafico precedente. Passare a un modello superiore è l’opzione meno costosa: è questo lo scopo di una gerarchia di modelli. Se state ancora scegliendo in generale tra i diversi livelli, il confronto delle capacità tra i livelli dei modelli Claude risponde a una domanda diversa da quella trattata in questa pagina.
Tre attività in cui Sonnet 5 o Haiku 4.5 sono la scelta corretta
Classificazione ed estrazione ad alto volume. Queste attività vengono valutate in base alla velocità di elaborazione e al costo unitario, mentre il livello qualitativo richiesto è abbastanza basso da poter essere raggiunto da un modello economico. Se Haiku 4.5 completa correttamente un'attività a un decimo del costo, Fable 5 non offre alcun vantaggio misurabile.
Attività interattive in cui la latenza è determinante. La tabella dei modelli di Anthropic indica che la latenza comparativa di Fable 5 è maggiore e il ragionamento non può essere disabilitato. Una casella di chat o il completamento in un editor risultano meno reattivi con il modello più capace, perché gli utenti percepiscono l'attesa prima di percepire la qualità.
Qualsiasi attività che dipenda da eventi successivi a January 2026. Il limite affidabile delle conoscenze di Fable 5 è January 2026. Quello di Opus 5 è May 2026. Il modello più costoso è quello meno aggiornato: per le domande sulla situazione più recente, si paga il doppio per conoscenze più datate, a meno di fornirgli strumenti di ricerca o recupero dei dati.
Un vincolo non dipende affatto dal costo. Fable 5 prevede una conservazione dei dati di 30 day e non è disponibile con zero data retention, perché è designato come Covered Model. Se il contratto richiede zero retention, Fable 5 non è un'opzione a nessun prezzo e nessuno sconto modifica questa condizione.
Cosa mostrano i repository fable-method e cosa non mostrano
Alcuni utenti hanno pubblicato repository che sintetizzano il funzionamento degli approcci Fable 5 in competenze che un modello meno costoso può seguire. Il repository fable-method descrive una competenza di ragionamento, un ciclo di orchestrazione e un verificatore antagonista che esegue nuovamente ogni controllo dichiarato, invece di limitarsi a leggere il resoconto dell'agente. Il README lo dichiara direttamente: "Questa è una sintesi della community, non un prodotto Anthropic."
Consideralo esattamente per quello che è. Costituisce una prova di come le persone guidano il modello, non una documentazione del suo funzionamento. Anthropic non ha convalidato alcun elemento del repository e ne esistono diversi fork quasi identici con formulazioni differenti. È ciò che ci si aspetterebbe da una tradizione informale, non da una specifica.
L'indicazione utile per una decisione sui costi è che le parti ritenute degne di essere copiate sono procedurali. Classifica l'attività, indica il controllo che dimostra che è completata, raccogli le evidenze prima di decidere, quindi verifica tramite osservazione invece di leggere un riepilogo. Se fornisci a un modello meno costoso una checklist esplicita e una fase di verifica, puoi ridurre in parte il divario. Esegui quindi questo esperimento sul tuo set di valutazione prima di adottare il modello più costoso come standard. Il risultato dipende dalle tue attività. Per questo, il valore del numero ottenuto da altri è limitato per te.
Controlla i tuoi numeri prima di impegnare il budget
- Leggi
usagein ogni risposta e registraoutput_tokens_details.thinking_tokensseparatamente dall'output visibile. Il ragionamento che non puoi vedere è la voce di costo che sorprende. - Imposta esplicitamente
effortinvece di accettare il valore predefinito e mantienilo costante all'interno di ogni conversazione che usa il prompt caching. - Inserisci prima il prefisso stabile dietro un punto di interruzione della cache. Una lettura dalla cache a un decimo del prezzo dell'input di base consente di risparmiare più della maggior parte dei downgrade del modello.
- Sposta nella Batch API tutto ciò che non richiede una risposta immediata.
- Valuta onestamente le alternative. Confrontare i prezzi delle API di Claude e ChatGPT sul tuo carico di lavoro vale un pomeriggio prima di assumere un impegno a lungo termine.
Se il carico di lavoro consiste in un agent eseguito sul tuo server, i controlli più importanti sono esterni alla scelta del modello. Contenere i costi di un agent su un VPS illustra i limiti del ciclo e i massimali di spesa che impediscono a una sessione fuori controllo di continuare a consumare risorse, mentre dove Claude Code usa effettivamente i token spiega i numeri visualizzati nel dashboard di utilizzo.
FAQ
Quanto costa Claude Fable 5 per milione di token?
Claude Fable 5 è disponibile a $10 per milione di token di input e $50 per milione di token di output tramite Claude API, secondo i prezzi verificati nella pagina dei prezzi di Anthropic il 3 agosto 2026. La lettura dalla cache costa $1 per milione di token, cioè un decimo della tariffa base per l'input. La Batch API applica uno sconto del 50% a entrambe le categorie, con tariffe di $5 e $25 per milione di token per le elaborazioni asincrone. Mantenere l'inferenza negli Stati Uniti tramite il parametro inference_geo applica un moltiplicatore di 1.1 a ogni categoria.
Claude Fable 5 è incluso in un abbonamento Claude Pro?
La pagina di Claude Fable di Anthropic indica il modello come disponibile per gli utenti Pro, Max, Team ed Enterprise e non cita il piano gratuito. L'accesso incluso non è illimitato. Alcuni account possono usare Fable entro i limiti settimanali di utilizzo, mentre altri vi accedono tramite crediti di utilizzo. Questa modalità è cambiata più volte nel corso di luglio 2026. Consulta la riga Fable nella tabella di confronto dei piani sulla pagina dei prezzi di Anthropic il giorno in cui prendi la decisione, invece di fare affidamento su un valore riportato in un articolo. Quando l'allowance incluso è esaurito, l'utilizzo aggiuntivo viene fatturato alla tariffa API.
Perché la fattura di Claude Fable 5 è più alta di quanto suggerisca l'output visibile?
Il thinking adattivo è sempre attivo in Claude Fable 5, i token di thinking vengono fatturati come token di output e il chain of thought grezzo non viene mai restituito. Con thinking.display al valore predefinito omitted, viene visualizzato un campo thinking vuoto, anche se vengono fatturati tutti i token di ragionamento sottostanti. Leggi usage.output_tokens_details.thinking_tokens nella risposta per visualizzare la suddivisione e considera che, durante lo streaming, questo campo arriva soltanto nell'evento finale message_delta. Riduci il livello effort se il rapporto tra ragionamento e risposta è superiore a quanto richiede l'attività.
Devo usare Claude Fable 5 o Claude Opus 5?
Claude Opus 5 costa la metà per token e dispone di un knowledge cutoff affidabile più recente: maggio 2026, contro gennaio 2026 per Fable 5. Inizia con Opus 5 e passa a un modello superiore quando un'attività non riesce con quel modello o quando il costo di una risposta errata supera la differenza di prezzo. Fable 5 è la scelta corretta per attività agentiche di lunga durata, in cui un ramo errato richiederebbe ore di correzioni, e per attività una tantum il cui sovrapprezzo viene addebitato su una singola fattura invece che su ogni richiesta a tempo indefinito.