Confronto provider · settembre 2026

Quanto costa un token, e quanto costa un turno

Claude Sonnet 5, Gemini 2.5 e 3.1 Pro, OpenAI GPT-5.6 e DeepSeek v4 a listino, con Regolo.ai come riferimento europeo. I prezzi per milione di token sono la parte facile: quello che decide la bolletta è come ciascun provider fa pagare la cache. In fondo, gli stessi modelli misurati su un carico agentico reale da 1,78 miliardi di token al mese, con e senza cache.

Rilevato 1 settembre 2026 Cambio 1 EUR = 1,1596 USD (31/08/2026) Sostituisce la rilevazione del 27/07/2026
Cambiato da luglio

Sonnet 5 resta a 2 e 10 dollari

La rilevazione di luglio dava il prezzo di Sonnet 5 come introduttivo fino al 31 agosto 2026, con aumento a 3/15 dal 1 settembre. L'aumento non c'è stato: Anthropic ha reso permanente il prezzo di lancio, e il listino di oggi è 2 dollari per milione di token in ingresso e 10 in uscita. Chi aveva messo a budget il rincaro può toglierlo.

Le altre due differenze rispetto a luglio: OpenAI mancava del tutto dal confronto e ora c'è, e il listino DeepSeek letto oggi è più alto di quello registrato allora (0,44/0,87 a luglio contro 1,32/3,96 in fascia piena oggi). Il salto è troppo grande per essere un ritocco: o la rilevazione di luglio guardava una tariffa scontata, o il listino è stato rivisto. In tabella c'è quello leggibile oggi sulla pagina del provider.

Prezzo dei token in uscita

Output, dollari per milione di token

L'output è la voce che pesa di più nell'uso interattivo. Scala 0–15 $/1M, fascia di lavoro: Opus 5 e Fable 5 stanno fuori scala e sono in tabella.

ModelloUSD per 1M token di output
DeepSeek v4-flash ridotta
0,66
DeepSeek v4-flash piena
1,32
DeepSeek v4-pro ridotta
1,98
DeepSeek v4-pro piena
3,96
regolo-qwen · qwen3.5-122b
4,87
Claude Haiku 4.5
5,00
Gemini 2.5 Pro ≤200K
10,00
Claude Sonnet 5
10,00
Gemini 3.1 Pro ≤200K
12,00
OpenAI gpt-5.6-terra
12,00
Gemini 2.5 Pro >200K
15,00
OpenAI gpt-5.4
15,00
Anthropic Google OpenAI DeepSeek Regolo.ai
Prezzo dei token in ingresso

Input, dollari per milione di token

Scala 0–5 $/1M. Qui i listini si stringono, ed è la riga che la cache cambia di dieci volte.

ModelloUSD per 1M token di input
DeepSeek v4-flash ridotta
0,22
DeepSeek v4-flash piena
0,44
DeepSeek v4-pro ridotta
0,66
Claude Haiku 4.5
1,00
Gemini 2.5 Pro ≤200K
1,25
DeepSeek v4-pro piena
1,32
Claude Sonnet 5
2,00
Gemini 3.1 Pro ≤200K
2,00
OpenAI gpt-5.6-terra
2,00
Gemini 2.5 Pro >200K
2,50
OpenAI gpt-5.4
2,50
OpenAI gpt-5.6-sol
4,00
Listino completo

Tutti i numeri

Prezzi in dollari per milione di token. La colonna cache è il costo di rilettura di un token già in cache, che è la voce decisiva in una sessione lunga.

ProviderModelloInput /1MCache read /1MOutput /1MContesto
AnthropicClaude Sonnet 5$2,00$0,20$10,001M
AnthropicClaude Haiku 4.5$1,00$0,10$5,00200K
AnthropicClaude Opus 5$5,00$0,50$25,001M
AnthropicClaude Fable 5$10,00$1,00$50,001M
GoogleGemini 2.5 Pro ≤200K$1,25$0,125$10,001M
GoogleGemini 2.5 Pro >200K$2,50$0,25$15,001M
GoogleGemini 3.1 Pro ≤200K$2,00$0,20$12,00n.d.
GoogleGemini 3.1 Pro >200K$4,00$0,40$18,00n.d.
OpenAIgpt-5.6-terra$2,00$0,20$12,00n.d.
OpenAIgpt-5.6-sol$4,00$0,40$20,00n.d.
OpenAIgpt-5.6-luna$0,20$0,02$1,20n.d.
OpenAIgpt-5.4$2,50$0,25$15,00272K
OpenAIgpt-5.5$5,00$0,50$30,00272K
DeepSeekv4-pro piena$1,32$0,044$3,961M
DeepSeekv4-pro ridotta$0,66$0,022$1,981M
DeepSeekv4-flash piena$0,44$0,014$1,321M
DeepSeekv4-flash ridotta$0,22$0,007$0,661M
Regoloqwen3.5-9b · €0,07 / €0,35$0,08$0,41262K
Regoloqwen3-coder-next · €0,50 / €2,00$0,58$2,32262K
Regoloqwen3.5-122b · €1,00 / €4,20$1,16$4,87262K
Regologlm5.2 · €2,00 / €5,20$2,32$6,03n.d.

DeepSeek applica due tariffe: piena nelle ore di punta (01:00–04:00 e 06:00–10:00 UTC, da lunedì a venerdì) e ridotta a metà prezzo nel resto della giornata. I prezzi Regolo sono IVA esclusa e convertiti al cambio in testata; su Regolo il campo usage non espone la cache, quindi la colonna resta vuota. Il contesto di 262144 token dei modelli Regolo è misurato sull'endpoint, per gli altri è quello dichiarato.

Il conto che conta

Un turno da 100K di contesto

Un agente rimanda tutto il contesto a ogni turno. Con 100K token di contesto e 1K di risposta, il turno vale 100K di input: il listino da solo non dice quanto spendi, lo dice quanto di quell'input paghi dalla cache.

ModelloTurno senza cacheTurno con 90% in cacheRapporto
DeepSeek v4-pro ridotta$0,068$0,0116,4x
DeepSeek v4-pro piena$0,136$0,0216,4x
Gemini 2.5 Pro$0,135$0,034 + affitto4,0x
Claude Sonnet 5$0,210$0,0484,4x
OpenAI gpt-5.6-terra$0,212$0,0504,2x
Gemini 3.1 Pro$0,212$0,050 + affitto4,2x
L'affitto della cache di Google

Anthropic e OpenAI fanno pagare la cache a consumo: Anthropic una scrittura maggiorata (1,25x per cinque minuti, 2x per un'ora), OpenAI niente in scrittura e un decimo in rilettura. Google fa pagare anche lo stoccaggio: 4,50 dollari per milione di token, all'ora. Tenere 90K token in cache costa 0,40 dollari l'ora a prescindere da quante volte li leggi. Su una sessione fitta si spalma e non si sente; su un contesto grande che resta caldo fra una domanda e l'altra diventa la voce principale del conto.

Il token di Claude non è il token di Gemini

Dai Claude 4.7 in poi, Sonnet 5 compreso, Anthropic usa un tokenizer nuovo che produce circa il 30% di token in più sullo stesso testo. Il confronto a listino qui sopra è per token, non per testo: su testo comparabile Sonnet 5 costa in pratica intorno a 2,60 in ingresso e 13 in uscita. L'esatto dipende dal contenuto, e va misurato sul proprio carico prima di ancorarci un preventivo.

Da sapere prima di scegliere

Quattro cose che i listini non dicono

DeepSeek costa il doppio metà giornata

La tariffa piena vale 01:00–04:00 e 06:00–10:00 UTC dal lunedì al venerdì, cioè 03:00–06:00 e 08:00–12:00 in Italia. È la fascia in cui si lavora: un carico interattivo europeo prende la tariffa piena quasi sempre, e la metà prezzo la vede solo il batch notturno. Un preventivo costruito sul prezzo ridotto sottostima di due volte.

Gemini raddoppia sopra i 200K

Gemini 2.5 Pro passa da 1,25/10,00 a 2,50/15,00 quando il prompt supera i 200K token, e 3.1 Pro da 2,00/12,00 a 4,00/18,00. La soglia è sul singolo prompt, quindi un agente che accumula contesto ci sbatte contro a metà sessione e il costo per turno raddoppia senza che nulla nel codice sia cambiato. Anthropic tiene un prezzo unico su tutto il milione di token.

Gemini 3.1 Pro è in preview

Il modello si chiama gemini-3.1-pro-preview. Per un confronto stabile con Sonnet 5 il termine di paragone difendibile resta 2.5 Pro, che è in disponibilità generale, ha il contesto dichiarato e il prezzo più basso dei due. Un listino di preview può cambiare al passaggio in GA.

Su Regolo il fallback è silenzioso

Rilevato il 27 luglio e non riverificato oggi: quando una richiesta a un modello Regolo fallisce, l'API ripiega su un altro modello e risponde senza errore. Una chiamata a qwen3-coder-next è tornata con "model": "gpt-oss-20b". Il campo model della risposta è l'unico posto dove si vede, e va letto se il costo per token del modello servito conta.

Cache o non cache

Le tre economie, misurate su un carico vero

I confronti qui sopra sono di listino. Questa sezione usa invece il consumo reale di un village agentico per un mese: 1,78 miliardi di token di contesto processati su 7 utenti, di cui il 91,5% riletto dalla cache, e 7,9 milioni di token di output. I dati vengono dai transcript reali, deduplicati per file e per identificativo del messaggio.

1,78 mld
Token di contesto / mese
Su 7 utenti attivi e 12.681 chiamate al modello. Un turno utente ne genera decine: il costo si conta in chiamate, non in messaggi.
91,5%
Contesto riletto dalla cache
Un agente rimanda lo stesso contesto a ogni giro. La cache non è un'ottimizzazione marginale: è quasi tutta la bolletta.
44%
Quota della scrittura in cache
Su Claude Sonnet 5 la voce più cara non è l'input né l'output: è scrivere la cache. Nessun listino la mostra.

Lo stesso mese, pagato in tre modi

ModelloCon cacheSenza cacheQuanto pesa la cache
OpenAI gpt-5.6-luna$73$3665,0x
DeepSeek v4-flash$100$7947,9x
Regolo qwen3.5-9b$146non ha cache
DeepSeek v4-pro$304$2.3837,8x
Claude Haiku 4.5$389$1.8214,7x
Gemini 2.5 Pro$473$2.3064,9x
OpenAI gpt-5.6-terra$726$3.6585,2x
Claude Sonnet 5$779$3.6424,7x
Regolo qwen3.5-122b$2.105non ha cache

"Senza cache" è lo stesso identico carico pagato con tutto il contesto a prezzo di input pieno, che è la condizione reale di chi non ha prompt caching. La colonna vale sia come previsione per un provider senza cache, sia come misura di quanto si perde quando la cache non aggancia.

Tre modi diversi di far pagare la stessa cosa

Anthropic fa pagare la scrittura più del prezzo di input (1,25x a cinque minuti, 2x a un'ora) e la rilettura un decimo. Su un carico che riscrive molto, la scrittura diventa la voce dominante. OpenAI, Gemini e DeepSeek non fanno pagare la scrittura come voce separata: il contesto nuovo entra a prezzo di input e la rilettura costa un decimo o meno. Regolo non espone la cache affatto, quindi ogni chiamata paga l'intero contesto a prezzo pieno: sul modello piccolo resta la spesa più bassa in assoluto, sul modello grande diventa la più alta.

La terza economia: il forfait

Le due colonne qui sopra sono entrambe a consumo. C'è una terza famiglia che non guarda i token: un abbonamento (Claude Max 20x, intorno ai 200 dollari al mese) o ferro proprio (una macchina a due GPU da 24 GB, intorno ai 350 dollari al mese). In entrambi i casi il conto non si muove se il volume raddoppia.

Su questo carico il confronto si chiude da solo: lo stesso mese costa 779 dollari a consumo su Sonnet 5 e 200-350 a forfait. Il driver di costo di un village sono miliardi di token di contesto riletti, ed è esattamente la quantità che un forfait ignora e un contatore moltiplica.

Il forfait però non si rivende

Un abbonamento personale che regge il carico oggi non è una base di prezzo per un prodotto venduto a terzi: è legato a un account, ha limiti di frequenza propri, e non è pensato per fare da motore a un servizio multi-cliente. Chi progetta un canone per utente deve usare la colonna a consumo, non la bolletta che vede oggi. La differenza fra le due è di un ordine di grandezza, ed è il punto in cui un listino costruito sull'esperienza diretta diventa una vendita in perdita.

Come leggere questi numeri

Dove si decide davvero

A listino i quattro provider stanno in una forbice stretta. Sull'output della fascia di lavoro Sonnet 5 e Gemini 2.5 Pro sono allineati a 10 dollari, OpenAI gpt-5.6-terra e Gemini 3.1 Pro a 12, e DeepSeek v4-pro sta sotto di due volte e mezzo. Sull'input Gemini 2.5 Pro è il più economico dei tre occidentali a 1,25 contro i 2,00 di Sonnet 5 e terra.

Con la cache accesa la classifica si comprime: fra Sonnet 5, terra e 3.1 Pro il turno da 100K costa fra 4,8 e 5,0 centesimi, cioè la stessa cifra. A quel punto il prezzo non è più il criterio di scelta, e decidono la qualità sul carico specifico, il tokenizer, la soglia dei 200K e dove finiscono i dati.

DeepSeek resta la metà di tutti anche con la cache. Regolo non compete sul prezzo assoluto e non ha cache: il suo argomento sono la latenza (inferenza in Italia) e il perimetro europeo dei dati. Se quei due fattori non pesano sul carico che hai in mano, il confronto si chiude sui numeri qui sopra.

Fonti