Claude o ChatGPT API: quale costa meno?
Confronta Claude e ChatGPT API con la formula dei token, tre casi con costi reali e i livelli in cui Claude costa di più o conviene sull'output.
La risposta breve
Il confronto dei prezzi API tra Claude e ChatGPT non ha un vincitore assoluto, perché i due fornitori applicano prezzi diversi ai token di input e di output in ogni livello. Ad agosto 2026, i due livelli superiori di Claude applicano lo stesso prezzo per token di input dei corrispondenti livelli di OpenAI e un prezzo inferiore per token di output. Claude risulta quindi leggermente più conveniente per i carichi di lavoro con molto output. Nel livello più piccolo, Claude costa diverse volte di più per lo stesso lavoro. Qualsiasi risposta che non indichi un livello e una combinazione di token è solo una stima.
Questa pagina presenta prima il calcolo, poi tre carichi di lavoro con i relativi mix di token e infine i moltiplicatori che possono incidere sul costo reale più della tariffa pubblicizzata.
L'unica formula necessaria
Entrambe le API fatturano il testo nello stesso modo. Si paga per i token inviati e si applica una tariffa più alta ai token generati dal modello.
cost = (input tokens / 1,000,000) * input rate + (output tokens / 1,000,000) * output rate
Un token corrisponde a circa 4 caratteri in inglese, ovvero a quasi 0.75 parole. Usalo solo per una prima stima. Per calcolare il costo effettivo, usa i conteggi restituiti da ciascuna API nell'oggetto usage di ogni risposta.
# Rates are US dollars per million tokens.
def cost(in_tok, out_tok, in_rate, out_rate):
return in_tok / 1e6 * in_rate + out_tok / 1e6 * out_rate
# One support-chat turn: 1,400 tokens in, 220 tokens out, on a $2 / $10 model.
print(round(cost(1400, 220, 2.0, 10.0), 6))Lo script stampa 0.005, cioè mezzo centesimo per turno. Moltiplica questo valore per il numero di turni previsti in un mese per ottenere il budget. Impara questa formula: ogni futura modifica dei prezzi richiederà una sola modifica, invece di una nuova analisi.
Le tariffe pubblicate, agosto 2026
Questi sono i prezzi di listino pubblicati da entrambi i fornitori il 1 agosto 2026. Questo blocco è l'unico punto dell'articolo in cui viene indicato un prezzo. Verificatelo sulla pagina claude.com/pricing e sulla pagina dei prezzi di OpenAI prima di definire il budget.
The data behind this chart
[
{
"label": "Frontier",
"claude_input": 5,
"claude_output": 25,
"openai_input": 5,
"openai_output": 30
},
{
"label": "Workhorse",
"claude_input": 2,
"claude_output": 10,
"openai_input": 2,
"openai_output": 12
},
{
"label": "Workhorse from September",
"claude_input": 3,
"claude_output": 15,
"openai_input": 2,
"openai_output": 12
},
{
"label": "Small",
"claude_input": 1,
"claude_output": 5,
"openai_input": 0.2,
"openai_output": 1.2
}
]Gli abbinamenti sono determinati dalla posizione nella rispettiva gamma, non dalla notorietà. Nella fascia Frontier, Claude Opus 5 è confrontato con gpt-5.6-sol. Nella fascia Workhorse, Claude Sonnet 5 è confrontato con gpt-5.6-terra. Nella fascia Small, Claude Haiku 4.5 è confrontato con gpt-5.6-luna. Entrambi i fornitori vendono anche piani di fascia superiore a quelli riportati in questo blocco e OpenAI mantiene nell'elenco le generazioni precedenti alle tariffe originali. Confrontare un modello di punta da una parte con un modello economico dall'altra produce un valore privo di significato. È così che la maggior parte dei confronti pubblicati ottiene il titolo principale.
Nel blocco ci sono due aspetti che devono essere esplicitati. Le tariffe di 2 e 10 di Sonnet 5 sono tariffe introduttive. Anthropic specifica che terminano il 31 agosto 2026. In seguito, Sonnet 5 applicherà 3 e 15. Questa modifica trasforma la fascia Workhorse da una vittoria di misura per Claude in una vittoria netta per OpenAI, e avverrà durante il periodo di validità di questo articolo.
Il secondo aspetto è uno schema che vale la pena ricordare: Claude applica all'output una tariffa esattamente 5 volte superiore alla propria tariffa di input in ogni riga precedente, mentre OpenAI applica una tariffa 6 volte superiore. È questo rapporto, non la tariffa assoluta, a determinare il cambio del vincitore in base alla combinazione di token utilizzata.
Perché una tariffa per milione di token non consente il confronto tra fornitori
Una tariffa è un importo in dollari per token. Un addebito è l'importo in dollari per token moltiplicato per il numero di token. Il numero di token di un testo dipende dal modello, non dal testo.
Anthropic lo documenta direttamente: i modelli Claude 4.7 e successivi, inclusi Claude Opus 5 e Claude Sonnet 5, usano un tokenizer più recente che produce circa il 30% di token in più per lo stesso testo rispetto a Claude Sonnet 4.6 e ai modelli precedenti. La tariffa non è cambiata. L'addebito sì.
Quindi due tariffe che sembrano identiche non corrispondono a due addebiti identici. Conta i token su entrambi i lati, usando il tuo testo, prima di considerare attendibile qualsiasi confronto, incluso questo.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5",
"messages": [{"role": "user", "content": "Summarise the attached contract."}]
}'Una risposta corretta è un piccolo oggetto JSON che contiene input_tokens. Un 401 indica che la variabile della chiave è vuota nella shell. Esegui lo stesso testo tramite il tokenizer dell'altro fornitore, dividi un conteggio per l'altro, quindi moltiplica il rapporto ottenuto per la tariffa pubblicata prima di effettuare il confronto. Se il rapporto favorisce un fornitore di oltre circa 1.2, questo effetto supera qualsiasi differenza di tariffa nel blocco precedente.
Scenario uno: una funzione di chat
Un assistente di supporto all'interno di un'applicazione web. 120,000 turni al mese. Ogni turno invia un prompt di sistema, gli schemi degli strumenti, due estratti recuperati dalla knowledge base dell'help desk e alcuni messaggi precedenti, per circa 1,400 token di input; il modello risponde con circa 220 token. È interattivo, quindi lo sconto per l'elaborazione batch non può mai applicarsi. Eseguilo sul livello workhorse.
The data behind this chart
[
{
"label": "List price",
"claude_usd": "600.00",
"openai_usd": "652.80"
},
{
"label": "Cached prefix",
"claude_usd": "427.20",
"openai_usd": "480.00"
},
{
"label": "Small tier, cached",
"claude_usd": "213.60",
"openai_usd": "48.00"
}
]Al prezzo di listino, Claude fattura 600.00 rispetto a 652.80 di OpenAI. Le componenti di input sono identiche, perché le tariffe di input sono identiche. L'intera differenza riguarda l'output e Claude la riduce con un margine troppo piccolo per scegliere un fornitore in base a questo criterio.
Ora considera 800 di quei 1,400 token di input come un prefisso stabile: il prompt di sistema e gli schemi degli strumenti, che non cambiano tra i turni. Entrambi i fornitori applicano il 10% della tariffa di base dell'input per un riscontro positivo nella cache. Il costo di Claude scende a 427.20 e quello di OpenAI a 480.00. La memorizzazione nella cache vale più della scelta del fornitore, ed entrambe le piattaforme la supportano.
È qui che Claude perde. La maggior parte delle risposte di supporto non richiede un modello workhorse. Sposta lo stesso traffico sul livello small: Claude fattura 213.60, mentre OpenAI fattura 48.00. Dividendo il primo costo per il secondo, Claude risulta circa quattro volte e mezza più costoso per lo stesso lavoro. Claude Haiku 4.5 applica 1 per milione di token di input, rispetto a 0.2 per gpt-5.6-luna, e nessuna quantità di caching elimina una differenza di cinque volte. Se il tuo carico di lavoro è adatto a un modello small, OpenAI è più economico e il margine è ampio.
Scenario due: una pipeline di documenti con contesto lungo
25.000 contratti al mese. Ogni richiesta contiene le stesse istruzioni da 9.000 token e lo stesso schema JSON, poi 12.000 token di testo del contratto; il modello restituisce circa 700 token di campi strutturati. In questo lavoro l'output rappresenta meno del 4% dei token, e questo singolo dato determina il confronto.
The data behind this chart
[
{
"label": "Chat feature",
"claude_usd": "427.20",
"openai_usd": "480.00"
},
{
"label": "Document pipeline",
"claude_usd": "820.00",
"openai_usd": "855.00"
},
{
"label": "Coding agent",
"claude_usd": "116.10",
"openai_usd": "124.20"
}
]Con il prefisso da 9.000 token memorizzato nella cache su entrambi i lati, Claude costa 820.00 e OpenAI costa 855.00. I costi degli input coincidono al centesimo, perché ad agosto 2026 le tariffe per gli input principali sono identiche. L'intera differenza riguarda l'output, il cui prezzo è 5 volte quello dell'input su Claude e 6 volte su OpenAI.
Anche questo lavoro può essere elaborato in batch. Entrambi i fornitori applicano uno sconto del 50% agli input e agli output per l'elaborazione asincrona, quindi entrambi i totali si dimezzano e la differenza mantiene la stessa proporzione. Il batch è il maggiore sconto singolo disponibile su entrambe le piattaforme, e una pipeline notturna di documenti può sempre utilizzarlo.
Claude è svantaggiato per la stessa logica dei livelli descritta in precedenza. L'estrazione di campi in base a uno schema fisso è esattamente il tipo di attività in cui un modello piccolo è efficace, e gli input rappresentano il 97% dei token in questo caso. Scendendo di un livello, la tariffa OpenAI per gli input si moltiplica per 0.1, mentre quella di Claude si moltiplica per 0.5. Testa il modello piccolo su 200 documenti prima di ritenere necessario quello più grande, utilizzando la stessa valutazione che useresti per scegliere il livello Claude più adatto a un'attività.
Scenario tre: un agente di sviluppo sempre attivo
Un singolo sviluppatore esegue un agente su un VPS, per circa 900 turni del modello al mese. Ogni turno include circa 60.000 token di input del contesto del repository, l'80% dei quali è servito dalla cache, e produce circa 1.800 token di modifiche e spiegazioni. Usa il livello frontier per il prezzo, perché nello sviluppo software una differenza di capacità comporta costi reali.
Claude fattura 116.10, rispetto ai 124.20 di OpenAI. La tariffa di input è la stessa, così come la tariffa per le letture dalla cache, e la tariffa di output inferiore di Claude comporta un risparmio di circa il 7%.
Quel 7% rientra nel margine di errore del tokenizer visto in precedenza, quindi considera questo scenario un pareggio delle tariffe. Il modello di fatturazione, invece, non è equivalente. Per un singolo sviluppatore con questo volume, un abbonamento per postazione costa di solito meno delle chiamate API fatturate a consumo, e il confronto cambia completamente quando ne includi uno. Analizza il confronto tra costi dell'API e dell'abbonamento prima di configurare un agente con fatturazione a consumo. Se scegli la fatturazione a consumo, determina prima dove vengono usati i token, perché l'utilizzo dei token da parte di un agente di sviluppo è dominato dal contesto reinviato a ogni turno, non dal codice che scrive.
I moltiplicatori che determinano il costo
La tariffa nominale è la voce più piccola di questo elenco. Ogni elemento seguente modifica il costo effettivo di oltre la differenza tra i due fornitori allo stesso livello.
Input memorizzato nella cache. Entrambi i fornitori applicano il 10% del costo dell'input di base quando si verifica un cache hit. Anthropic applica inoltre un costo per la scrittura nella cache: 1.25 volte l'input di base per una voce di cinque minuti e 2 volte per una voce di un'ora. Un hit successivo aggiorna la voce al prezzo di lettura. Pertanto, una voce di cinque minuti si ripaga dopo una lettura. Un carico di lavoro con intervalli lunghi tra le richieste scrive più spesso di quanto legga; in questo caso la memorizzazione nella cache costa più di quanto faccia risparmiare. Il traffico regolare beneficia della cache. Il traffico a raffiche no.
Sconti batch. Sconto del 50% su input e output su entrambe le piattaforme, solo per il lavoro asincrono. Se il job può attendere, il costo si dimezza con entrambi i fornitori e lo sconto si somma alla memorizzazione nella cache.
Percentuale di output. Claude applica all'output una tariffa 5 volte superiore a quella dell'input. OpenAI applica una tariffa 6 volte superiore. Quanto maggiore è la quantità di token scritti anziché letti, tanto più vantaggioso risulta Claude a parità di tariffa dell'input; per i carichi di lavoro dominati dall'input vale il contrario.
Retry. Un retry addebita nuovamente l'intero input e non restituisce nulla di utilizzabile. Se il 6% delle chiamate non supera la validazione dello schema e viene ritentato, il consumo di input è superiore del 6% a quanto previsto dal piano. Registra i retry come voce di costo, non come voce di errore. I team individuano per ultimi questo moltiplicatore, che spesso è maggiore della differenza tra i fornitori su cui hanno discusso per una settimana.
Chi perde e dove
Claude perde nettamente nel segmento più economico. gpt-5.6-luna costa 0.2 per milione di token di input, contro 1 di Claude Haiku 4.5; per l'output, i prezzi sono rispettivamente 1.2 e 5. La classificazione ad alto volume e l'estrazione breve costano circa quattro volte di più su Claude.
Claude perde nel segmento operativo dal 1 September 2026, quando termina la tariffa introduttiva e Sonnet 5 passa a 3 e 15, mentre gpt-5.6-terra mantiene la tariffa attuale. Claude vince nel segmento di frontiera per la tariffa di output, ma il margine può essere annullato dai conteggi effettivi dei token. Nessuno dei due vince nei carichi di lavoro dominati dall'input ad agosto 2026, perché a 2 per milione su entrambi i lati i costi dell'input sono identici.
Come misurare questi dati sul proprio traffico
Leggere l'oggetto usage in ogni risposta e memorizzare quattro valori per richiesta: token di input, token di output, token letti dalla cache e token scritti nella cache. Nell'API Claude questi valori arrivano come input_tokens, output_tokens, cache_read_input_tokens e cache_creation_input_tokens. Sommarli ogni giorno, moltiplicarli per le tariffe correnti e confrontare il totale con la fattura. Una differenza tra i due valori è solitamente dovuta a nuovi tentativi o a un percorso del codice di cui si è dimenticata la distribuzione.
Eseguire il confronto su una settimana di traffico reale invece che su un prompt di esempio e confrontare il costo per attività completata anziché il costo per token. Un modello che risponde al primo tentativo con una tariffa doppia costa meno di un modello che richiede tre tentativi con una tariffa dimezzata. Il costo per token è una tariffa. Il costo per attività completata è l'importo fatturato.
Impostare un limite massimo di spesa prima di lasciare qualsiasi processo in esecuzione. Entrambe le piattaforme espongono limiti di spesa nelle rispettive console e un agente bloccato in un ciclo di nuovi tentativi può consumare in una notte il budget di un mese. Configurare questo limite come si farebbe per il controllo dei costi di un agente sempre attivo. Se si sta sviluppando la prima versione su un server di propria gestione, una prima app Claude API su un VPS illustra la gestione delle chiavi e il ciclo delle richieste su cui si basa questo calcolo.
FAQ
L'API Claude è più economica dell'API ChatGPT?
Non in modo costante. Ad agosto 2026, i livelli frontier e workhorse applicano lo stesso costo per token di input su entrambe le piattaforme, mentre Claude applica un costo inferiore per token di output. Di conseguenza, Claude costa qualche punto percentuale in meno per i carichi di lavoro con molti output. Nel livello small, gpt-5.6-luna di OpenAI costa un quinto di Claude Haiku 4.5 per token di input, quindi la classificazione ad alto volume è molto più economica su OpenAI. Calcola il tuo valore usando la tua combinazione di token, perché una differenza così ridotta dipende dal carico di lavoro più che dal listino.
Perché le stesse parole hanno un costo diverso in token su API diverse?
Perché ogni modello ha il proprio tokenizer e il conteggio dei token dipende dal modello. Anthropic documenta che Claude 4.7 e i modelli successivi producono circa il 30% di token in più per lo stesso testo rispetto a Claude Sonnet 4.6 e ai modelli precedenti. Invia il tuo testo all'endpoint di conteggio dei token di ciascun fornitore, dividi un conteggio per l'altro, quindi moltiplica quel rapporto per la tariffa pubblicata prima di effettuare il confronto. Una differenza del 20% nel numero di token supera la maggior parte delle differenze tariffarie pubblicate.
Il prompt caching può mai aumentare il costo?
Sì, su Anthropic. La scrittura nella cache costa 1,25 volte la tariffa base per l'input per un elemento con durata di cinque minuti e 2 volte per un elemento con durata di un'ora, mentre un hit costa 0,1 volte la tariffa. Se il traffico è abbastanza intermittente da far scadere la maggior parte degli elementi prima che vengano letti, paghi il sovrapprezzo di scrittura senza ottenere alcun hit. Confronta cache_creation_input_tokens con cache_read_input_tokens nei log. Un rapporto vicino a 1 indica che il caching ti sta facendo spendere di più: aumenta la durata dell'elemento oppure rimuovilo.
Devo eseguire un coding agent tramite API o usare un abbonamento?
Per un singolo sviluppatore con un volume ordinario, un abbonamento per una postazione di solito costa meno della fatturazione API a consumo, perché un coding agent invia nuovamente un contesto ampio a ogni turno e quel contesto viene addebitato ogni volta. Misura i costi per una settimana, quindi confronta il totale API con il prezzo della postazione. L'API è più conveniente quando l'utilizzo è intermittente o quando ti serve un accesso programmatico che una postazione non offre.