Claude Fable 5: prezzo e quando usarlo
Claude Fable 5 costa 10 $ per milione di token in input e 50 $ in output. Scopri cosa significano le tariffe pubblicate per i lavori che esegui davvero.
Quanto costa Claude Fable 5?
Claude Fable 5 costa $10 per milione di token di input e $50 per milione di token di output sulla Claude API. Queste sono le tariffe di listino pubblicate da Anthropic, rilevate dalla pagina dei prezzi il 3 agosto 2026. L'ID del modello API è claude-fable-5. Il modello è diventato generalmente disponibile il 9 giugno 2026 sulla Claude API, su Amazon Bedrock, su Claude Platform on AWS, su Google Cloud e su Microsoft Foundry.
The data behind this chart
[
{
"label": "Claude Fable 5",
"input": "10",
"output": "50",
"cache_read": "1",
"batch_input": "5",
"batch_output": "25"
},
{
"label": "Claude Opus 5",
"input": "5",
"output": "25",
"cache_read": "0.50",
"batch_input": "2.50",
"batch_output": "12.50"
},
{
"label": "Claude Sonnet 5 (intro rate)",
"input": "2",
"output": "10",
"cache_read": "0.20",
"batch_input": "1",
"batch_output": "5"
},
{
"label": "Claude Sonnet 5 (from 1 Sep)",
"input": "3",
"output": "15",
"cache_read": "0.30",
"batch_input": "1.50",
"batch_output": "7.50"
},
{
"label": "Claude Haiku 4.5",
"input": "1",
"output": "5",
"cache_read": "0.10",
"batch_input": "0.50",
"batch_output": "2.50"
}
]Considerate questi prezzi come una scala. Fable 5 ha un prezzo di listino doppio rispetto a Claude Opus 5, cinque volte superiore alla tariffa attuale di Claude Sonnet 5 e dieci volte superiore a Claude Haiku 4.5. Il rapporto è uguale per input e output, perché ogni modello nella tabella applica all'output una tariffa esattamente cinque volte superiore alla propria tariffa di input. Quindi, se conoscete la ripartizione tra token di input e di output di un'attività, potete convertire un prezzo in qualsiasi altro moltiplicandolo.
Una data modifica il calcolo. Fino al 31 agosto 2026, Sonnet 5 è soggetto a un prezzo introduttivo di $2 e $10 per milione di token. Dal 1 settembre 2026 il prezzo di listino sarà $3 e $15. Il prezzo di Fable 5 non cambia, quindi quel giorno la differenza tra i due modelli si riduce da cinque volte a poco più di tre volte. Se state preparando il budget per l'autunno, utilizzate i valori successivi di Sonnet.
Gli sconti e l'unico moltiplicatore che aumenta il costo
Il caching dei prompt è la leva più importante. La lettura dalla cache costa un decimo del prezzo base dell'input, cioè $1 per milione di token su Fable 5. La scrittura nella cache costa più di un normale token di input: 1.25 volte il prezzo base per la cache di cinque minuti e 2 volte il prezzo base per la cache di un'ora. Una cache di cinque minuti si ripaga dopo una sola lettura, mentre una cache di un'ora si ripaga dopo due letture. Questo calcolo è l'intera motivazione per calcolare il punto di pareggio del caching dei prompt prima di abilitarlo ovunque.
La Batch API applica uno sconto del 50% a entrambi i lati, quindi i lavori Fable 5 elaborati in batch costano $5 per i token di input e $25 per i token di output, per milione di token. Le richieste batch sono asincrone, quindi questa opzione è utile solo per i lavori che non richiedono una risposta immediata. I due sconti si sommano e rendono economico un lavoro che usa sia la cache sia l'elaborazione batch.
La finestra di contesto da 1M token è inclusa alle tariffe standard su Claude 4.6 e sui modelli successivi. Non è previsto alcun sovrapprezzo per il contesto esteso, quindi una richiesta da 900k token viene fatturata alla stessa tariffa per token di una richiesta da 9k token.
Il moltiplicatore che aumenta il costo è la residenza dei dati. Impostando inference_geo: "us" per mantenere l'inferenza negli Stati Uniti si applica un moltiplicatore di 1.1 a ogni categoria di token, comprese le letture e le scritture nella cache. Mantieni il routing globale predefinito, salvo quando un contratto richiede diversamente.
Una regola di fatturazione è specifica per questo modello. Fable 5 include classificatori di sicurezza che possono rifiutare una richiesta. In questo caso, la Messages API restituisce stop_reason: "refusal" con una risposta HTTP 200 corretta invece di un errore e la richiesta rifiutata prima della generazione di qualsiasi output non viene addebitata. Se ripeti lo stesso prompt su un altro modello Claude, il credito di fallback rimborsa il costo della cache del prompt dovuto al passaggio, quindi non paghi due volte per riempire la stessa cache.
Quali piani includono Claude Fable 5?
Al 3 agosto 2026, la pagina di Anthropic dedicata a Claude Fable indica che il modello è disponibile per gli utenti Pro, Max, Team ed Enterprise. Il piano gratuito non è indicato. Pro è il piano più economico tra quelli elencati, quindi il costo di Pro e i limiti di utilizzo definiscono la soglia minima per qualsiasi abbonamento che consenta di usare Fable. Per gli sviluppatori, il modello è generalmente disponibile tramite Claude API e i cloud marketplace elencati sopra. Questo canale non prevede un livello gratuito, quindi il piccolo credito che Anthropic concede alla registrazione è tutto ciò che si riceve prima dell'inizio della fatturazione a consumo.
La disponibilità in un piano non equivale all'inclusione senza limiti. La tabella comparativa dei piani nella pagina dei prezzi di Anthropic subordina l'accesso a Fable a una quota dei limiti di utilizzo settimanali per alcuni abbonamenti e ai crediti di utilizzo per altri; questa struttura è cambiata più volte nel corso di luglio 2026. La dichiarazione di Anthropic sulla nuova distribuzione di Fable 5 includeva il modello fino al 50% dei limiti di utilizzo settimanali fino al 7 luglio 2026 per i piani Pro, Max, Team e alcuni piani Enterprise, con crediti di utilizzo dopo tale data. Le informazioni pubblicate nel resto di luglio descrivevano ulteriori proroghe e una distinzione tra i diversi tipi di abbonamento.
Per questo motivo, questa pagina non riporta un limite specifico per piano. Nessun dato pubblicato durante quel mese è rimasto valido per due settimane, e un numero non aggiornato sarebbe peggiore dell'assenza di un numero. Il giorno in cui decidi, apri la riga denominata Fable nella tabella comparativa dei piani e considera non aggiornato qualsiasi dato riportato in un articolo di cronaca. Se acquisti un abbonamento per accedere a Fable e la disponibilità risulta inferiore a quanto lasciava intendere la tabella, tornare a un piano inferiore prima del rinnovo successivo mantiene intatto il mese già pagato.
La tariffa API è invece stabile. Su qualsiasi canale, una volta esaurita la disponibilità inclusa, l'utilizzo aggiuntivo di Fable 5 viene fatturato ai prezzi riportati nel grafico sopra. Enterprise rende esplicita questa struttura, perché il costo dell'abbonamento Enterprise offre l'accesso, mentre i token continuano a essere fatturati alle tariffe API oltre a tale costo. In entrambi i casi, il listino è quindi il riferimento da usare per la pianificazione dei costi. È la stessa conclusione a cui si arriva confrontando la fatturazione API con un abbonamento per qualsiasi altro modello Claude. Se non hai ancora scelto un livello, parti da quale piano Claude corrisponde al tuo utilizzo. Se useresti lo stesso abbonamento anche come assistente quotidiano, anziché soltanto per accedere a Fable, conviene verificare come si confrontano i prezzi dei piani Claude con quelli di ChatGPT prima di procedere.
Perché il costo supera quanto suggerisce il rapporto tra i prezzi
Due meccanismi documentati fanno costare Fable 5 più di quanto lasci intendere un semplice confronto dei prezzi.
Il primo è il tokenizer. Fable 5 usa il tokenizer introdotto con Claude Opus 4.7. Rispetto ai modelli rilasciati prima di Opus 4.7, lo stesso testo produce circa il 30% di token in più; l'aumento esatto dipende dal contenuto. Haiku 4.5 è precedente a quel tokenizer, quindi il divario di dieci volte indicato nel listino diventa più vicino a tredici volte quando si fornisce a entrambi i modelli lo stesso blocco di testo. Sonnet 5 usa il tokenizer più recente, quindi il confronto tra Fable e Sonnet è corretto a parità di token. Il confronto tra Fable e Haiku non lo è.
Il secondo è il thinking. Il thinking adattivo è sempre attivo in Fable 5 e thinking: {"type": "disabled"} non è supportato. I token di thinking vengono fatturati come token di output, alla tariffa completa dell'output. Il chain of thought grezzo non viene mai restituito da questo modello e thinking.display ha come valore predefinito "omitted"; di conseguenza, una risposta visibile breve può includere un numero elevato di token di output fatturati. La documentazione di Anthropic lo dichiara chiaramente: il numero di token di output fatturati non corrisponde al numero di token visibili nella risposta.
Leggere il dettaglio invece di fare supposizioni. Il campo usage.output_tokens_details.thinking_tokens indica quanti token di output fatturati sono stati usati per il reasoning:
{
"usage": {
"input_tokens": 25,
"output_tokens": 348,
"output_tokens_details": {
"thinking_tokens": 312
}
}
}Nell'esempio, tratto dalla documentazione di Anthropic sul thinking, 312 dei 348 token di output fatturati erano usati per il reasoning e non sono mai stati visualizzati. Quando si usa lo streaming, questo dettaglio arriva soltanto nell'evento message_delta finale; un client che smette di leggere dopo l'ultimo blocco di testo non lo registrerà mai.
Il controllo è effort, impostato su output_config.effort, con i livelli low, medium, high (il valore predefinito), xhigh e max.
{
"model": "claude-fable-5",
"max_tokens": 32000,
"output_config": { "effort": "medium" },
"messages": [{ "role": "user", "content": "..." }]
}Per questo modello, Anthropic consiglia di iniziare da high, passare a xhigh soltanto per le attività più sensibili alle capacità del modello e scendere a medium o low per le attività di routine, perché su Fable 5 un effort inferiore spesso offre risultati migliori di xhigh sui modelli precedenti. Ci sono due rischi. Modificare l'effort tra una richiesta e l'altra invalida la prompt cache, perché il valore di effort risolto viene inserito nel prompt. Scegliere quindi un livello per ogni carico di lavoro e mantenerlo costante. Inoltre, max_tokens è un limite rigido sull'output totale, che comprende thinking e testo della risposta. Un limite dimensionato per una risposta senza thinking può quindi troncare l'output. La presenza di stop_reason: "max_tokens" indica che è necessario aumentare il limite oppure ridurre l'effort.
Costo per attività completata, non costo per token
The data behind this chart
[
{
"label": "Short answer (5k in, 1k out)",
"fable_5": "0.10",
"opus_5": "0.05",
"sonnet_5": "0.02",
"haiku_4_5": "0.01"
},
{
"label": "Coding session (300k in, 40k out)",
"fable_5": "5.00",
"opus_5": "2.50",
"sonnet_5": "1.00",
"haiku_4_5": "0.50"
},
{
"label": "Long agent run (2M in, 400k out)",
"fable_5": "40.00",
"opus_5": "20.00",
"sonnet_5": "8.00",
"haiku_4_5": "4.00"
}
]Quelle 3 righe contengono calcoli aritmetici, non un benchmark. Le tariffe sono pubblicate. I volumi di token sono ipotesi che dovresti sostituire con i dati del tuo utilizzo. Una sessione di programmazione con caratteristiche simili a quelle della riga centrale costa $5.00 su Fable 5, contro $1.00 su Sonnet 5. L'esecuzione lunga costa $40.00 contro $8.00. Il valore nella colonna Haiku dell'ultima riga è solo un calcolo aritmetico: Haiku 4.5 ha una finestra di contesto di 200k token, quindi non può contenere affatto quell'attività.
Il costo per token è l'unità di misura sbagliata per prendere una decisione. Il costo per attività completata è il costo per tentativo moltiplicato per il numero di tentativi. Alle tariffe odierne, un tentativo con Fable 5 costa quanto cinque tentativi con Sonnet 5; quindi il solo numero di retry quasi mai giustifica l'upgrade. Sonnet dovrebbe fallire più di quattro volte su cinque prima che il percorso più economico risulti sfavorevole in termini di token.
A giustificare la scelta sono invece tutti gli elementi che la fattura dei token non include. Nella maggior parte dei mercati, la differenza tra le due esecuzioni lunghe nel grafico è inferiore al costo di un'ora di lavoro di un tecnico. Se il modello più costoso fa risparmiare un'ora di revisione o evita una migrazione errata che dovresti poi annullare, si è già ripagato, anche se la fattura non mostra il risparmio. Confronta il costo per risultato accettato in termini monetari e includi nel totale anche il tuo tempo. Capire che cosa acquistano realmente un milione di token rende questa stima molto meno astratta.
Tre attività per cui Claude Fable 5 giustifica il costo
Esecuzioni di agenti su orizzonte esteso, in cui una deviazione è costosa. Fable 5 è progettato per attività misurate in ore: una finestra di contesto da 1M token, fino a 128k token di output per richiesta e un livello di impegno xhigh pensato per attività che durano oltre trenta minuti e utilizzano budget di milioni di token. Confronta il costo dell'esecuzione con quello della correzione necessaria dopo che un agente ha imboccato il ramo sbagliato al passaggio 40, senza che nessuno se ne accorgesse fino al passaggio 300.
Una migrazione o un audit eseguiti una sola volta su un codebase di grandi dimensioni. Per un'attività una tantum non esiste un volume sufficiente per ammortizzare il costo, quindi il sovrapprezzo per token ricade su un'unica fattura e l'intera attività potrebbe rientrare in una sola finestra di contesto. Se può essere eseguita in modo asincrono, la Batch API dimezza il costo a $25 per milione di token di output.
L'attività con cui un modello più economico ha già fallito due volte. Due tentativi falliti, sommati al tempo dedicato al debugging, costano più di un tentativo con Fable ai volumi indicati nel grafico precedente. Passare a un modello superiore è l'opzione meno costosa: è questo lo scopo di una gerarchia di modelli. Se stai ancora scegliendo in generale tra i diversi livelli, il confronto delle capacità tra i livelli dei modelli Claude risponde a una domanda diversa da quella trattata in questa pagina.
Tre attività in cui Sonnet 5 o Haiku 4.5 sono la scelta corretta
Classificazione ed estrazione ad alto volume. Queste attività vengono valutate in base alla velocità di elaborazione e al costo unitario, mentre il livello qualitativo massimo è abbastanza basso da essere raggiunto da un modello economico. Se Haiku 4.5 completa correttamente un'attività a un decimo del prezzo, Fable 5 non offre alcun vantaggio misurabile.
Attività interattive in cui la latenza è il fattore determinante. La tabella dei modelli di Anthropic indica che la latenza comparativa di Fable 5 è maggiore e il thinking non può essere disattivato. Una chat o il completamento nell'editor risultano peggiori con il modello più potente, perché gli utenti percepiscono l'attesa prima della qualità.
Qualsiasi attività che dipenda da eventi successivi a January 2026. Il cutoff affidabile della conoscenza di Fable 5 è January 2026. Quello di Opus 5 è May 2026. Il modello più costoso è quello meno aggiornato: per le domande sulla recency si paga il doppio per informazioni più vecchie, a meno di fornirgli strumenti di ricerca o fetch.
Un vincolo è indipendente dai costi. Fable 5 conserva i dati per 30 day e non è disponibile con zero data retention, perché è designato come Covered Model. Se il contratto richiede zero retention, Fable 5 non è un'opzione a nessun prezzo e nessuno sconto modifica questo vincolo.
Cosa mostrano i repository del metodo fable e cosa non mostrano
Alcuni professionisti hanno pubblicato repository che sintetizzano il funzionamento degli approcci Fable 5 in competenze che un modello meno costoso può seguire. Il repository fable-method descrive una competenza di ragionamento, un ciclo di orchestrazione e un verificatore avversariale che esegue nuovamente ogni controllo dichiarato invece di limitarsi a leggere il report dell'agente. Il README lo dichiara esplicitamente: "Questa è una sintesi della community, non un artefatto di Anthropic."
Consideralo esattamente per quello che è. Dimostra come le persone guidano il modello, ma non documenta il funzionamento interno del modello. Anthropic non ha convalidato nessuno dei suoi contenuti. Inoltre, esistono diversi fork quasi identici con formulazioni differenti. È il comportamento atteso per una tradizione orale, non per una specifica.
L'elemento utile per decidere sui costi è che le parti che le persone hanno ritenuto utili da copiare sono procedurali. Classifica l'attività, indica il controllo che dimostra che è completata, raccogli le evidenze prima di decidere, quindi verifica tramite osservazione invece di leggere un riepilogo. Se fornisci a un modello meno costoso una checklist esplicita e un passaggio di verifica, puoi ridurre in parte il divario. Esegui quindi questo esperimento sul tuo set di valutazione prima di adottare sistematicamente il modello più costoso. Il risultato dipende dalle tue attività. Per questo, il numero ottenuto da altri ha per te un valore limitato.
Verifica i tuoi numeri prima di impegnare il budget
- Leggi
usagein ogni risposta e registraoutput_tokens_details.thinking_tokensseparatamente dall’output visibile. Il ragionamento che non puoi vedere è la voce di costo che riserva le sorprese. - Imposta esplicitamente
effortinvece di accettare il valore predefinito e mantienilo costante all’interno di ogni conversazione che utilizza il prompt caching. - Inserisci prima il prefisso stabile dietro un punto di interruzione della cache. Una lettura dalla cache a un decimo del prezzo dell’input di base consente di risparmiare più di quanto facciano la maggior parte dei downgrade del modello.
- Sposta nella Batch API tutto ciò che non richiede una risposta immediata.
- Valuta con onestà l’alternativa. Confrontare i prezzi delle API di Claude e ChatGPT in base al tuo carico di lavoro vale un pomeriggio prima di assumere un impegno a lungo termine.
Se il carico di lavoro consiste in un agent eseguito sul tuo server, i controlli più importanti sono esterni alla scelta del modello. Tenere sotto controllo i costi di un agent su un VPS illustra i limiti del ciclo e i massimali di spesa che interrompono una sessione fuori controllo, mentre dove Claude Code consuma effettivamente i token spiega i numeri che vedrai nel dashboard di utilizzo.
FAQ
Quanto costa Claude Fable 5 per milione di token?
Claude Fable 5 è disponibile a $10 per milione di token di input e $50 per milione di token di output tramite Claude API, secondo i prezzi verificati nella pagina dei prezzi di Anthropic il 3 agosto 2026. La lettura dalla cache costa $1 per milione di token, cioè un decimo della tariffa base per l'input. La Batch API applica uno sconto del 50% a entrambe le categorie, portando il costo a $5 e $25 per milione di token per i processi asincroni. Mantenere l'inferenza negli Stati Uniti usando il parametro inference_geo applica un moltiplicatore di 1.1 a ogni categoria.
Claude Fable 5 è incluso in un abbonamento Claude Pro?
La pagina di Claude Fable di Anthropic indica il modello come disponibile per gli utenti Pro, Max, Team ed Enterprise e non cita il piano gratuito. L'accesso incluso non è illimitato. Alcuni account ricevono Fable come quota dei limiti di utilizzo settimanali, mentre altri lo usano tramite crediti di utilizzo; questa modalità è cambiata più di una volta nel corso di luglio 2026. Il giorno in cui devi decidere, consulta la riga denominata Fable nella tabella comparativa dei piani sulla pagina dei prezzi di Anthropic, invece di affidarti a un valore riportato in un articolo. Dopo l'esaurimento della quota inclusa, l'utilizzo aggiuntivo viene fatturato alla tariffa API.
Perché la fattura di Claude Fable 5 è più alta di quanto suggerisca l'output visibile?
Il ragionamento adattivo è sempre attivo per Claude Fable 5, i token di ragionamento vengono fatturati come token di output e la catena di pensiero grezza non viene mai restituita. Con thinking.display al valore predefinito omitted, viene visualizzato un campo di ragionamento vuoto, ma vengono fatturati tutti i token di ragionamento sottostanti. Leggi usage.output_tokens_details.thinking_tokens nella risposta per vedere la suddivisione e considera che, durante lo streaming, questo campo arriva soltanto nell'evento finale message_delta. Riduci il livello effort se il rapporto tra ragionamento e risposta è superiore a quanto richiesto dall'attività.
Devo usare Claude Fable 5 o Claude Opus 5?
Claude Opus 5 costa la metà per token e ha un limite di conoscenza affidabile più recente: maggio 2026, rispetto a gennaio 2026 per Fable 5. Inizia con Opus 5 e passa a un modello superiore quando un'attività non riesce con quel modello o quando il costo di una risposta errata supera la differenza di prezzo. Fable 5 è la scelta corretta per attività agentiche di lunga durata, in cui un ramo errato richiede ore di pulizia, e per i processi una tantum il cui sovrapprezzo viene addebitato su una singola fattura invece che su ogni richiesta in modo permanente.