Claude Sonnet 5, Gemini 2.5 e 3.1 Pro, OpenAI GPT-5.6 e DeepSeek v4 a listino, con Regolo.ai come riferimento europeo. I prezzi per milione di token sono la parte facile: quello che decide la bolletta è come ciascun provider fa pagare la cache. In fondo, gli stessi modelli misurati su un carico agentico reale da 1,78 miliardi di token al mese, con e senza cache.
La rilevazione di luglio dava il prezzo di Sonnet 5 come introduttivo fino al 31 agosto 2026, con aumento a 3/15 dal 1 settembre. L'aumento non c'è stato: Anthropic ha reso permanente il prezzo di lancio, e il listino di oggi è 2 dollari per milione di token in ingresso e 10 in uscita. Chi aveva messo a budget il rincaro può toglierlo.
Le altre due differenze rispetto a luglio: OpenAI mancava del tutto dal confronto e ora c'è, e il listino DeepSeek letto oggi è più alto di quello registrato allora (0,44/0,87 a luglio contro 1,32/3,96 in fascia piena oggi). Il salto è troppo grande per essere un ritocco: o la rilevazione di luglio guardava una tariffa scontata, o il listino è stato rivisto. In tabella c'è quello leggibile oggi sulla pagina del provider.
L'output è la voce che pesa di più nell'uso interattivo. Scala 0–15 $/1M, fascia di lavoro: Opus 5 e Fable 5 stanno fuori scala e sono in tabella.
Scala 0–5 $/1M. Qui i listini si stringono, ed è la riga che la cache cambia di dieci volte.
Prezzi in dollari per milione di token. La colonna cache è il costo di rilettura di un token già in cache, che è la voce decisiva in una sessione lunga.
| Provider | Modello | Input /1M | Cache read /1M | Output /1M | Contesto |
|---|---|---|---|---|---|
| Anthropic | Claude Sonnet 5 | $2,00 | $0,20 | $10,00 | 1M |
| Anthropic | Claude Haiku 4.5 | $1,00 | $0,10 | $5,00 | 200K |
| Anthropic | Claude Opus 5 | $5,00 | $0,50 | $25,00 | 1M |
| Anthropic | Claude Fable 5 | $10,00 | $1,00 | $50,00 | 1M |
| Gemini 2.5 Pro ≤200K | $1,25 | $0,125 | $10,00 | 1M | |
| Gemini 2.5 Pro >200K | $2,50 | $0,25 | $15,00 | 1M | |
| Gemini 3.1 Pro ≤200K | $2,00 | $0,20 | $12,00 | n.d. | |
| Gemini 3.1 Pro >200K | $4,00 | $0,40 | $18,00 | n.d. | |
| OpenAI | gpt-5.6-terra | $2,00 | $0,20 | $12,00 | n.d. |
| OpenAI | gpt-5.6-sol | $4,00 | $0,40 | $20,00 | n.d. |
| OpenAI | gpt-5.6-luna | $0,20 | $0,02 | $1,20 | n.d. |
| OpenAI | gpt-5.4 | $2,50 | $0,25 | $15,00 | 272K |
| OpenAI | gpt-5.5 | $5,00 | $0,50 | $30,00 | 272K |
| DeepSeek | v4-pro piena | $1,32 | $0,044 | $3,96 | 1M |
| DeepSeek | v4-pro ridotta | $0,66 | $0,022 | $1,98 | 1M |
| DeepSeek | v4-flash piena | $0,44 | $0,014 | $1,32 | 1M |
| DeepSeek | v4-flash ridotta | $0,22 | $0,007 | $0,66 | 1M |
| Regolo | qwen3.5-9b · €0,07 / €0,35 | $0,08 | — | $0,41 | 262K |
| Regolo | qwen3-coder-next · €0,50 / €2,00 | $0,58 | — | $2,32 | 262K |
| Regolo | qwen3.5-122b · €1,00 / €4,20 | $1,16 | — | $4,87 | 262K |
| Regolo | glm5.2 · €2,00 / €5,20 | $2,32 | — | $6,03 | n.d. |
DeepSeek applica due tariffe: piena nelle ore di punta (01:00–04:00 e 06:00–10:00 UTC, da lunedì a venerdì) e ridotta a metà prezzo nel resto della giornata. I prezzi Regolo sono IVA esclusa e convertiti al cambio in testata; su Regolo il campo usage non espone la cache, quindi la colonna resta vuota. Il contesto di 262144 token dei modelli Regolo è misurato sull'endpoint, per gli altri è quello dichiarato.
Un agente rimanda tutto il contesto a ogni turno. Con 100K token di contesto e 1K di risposta, il turno vale 100K di input: il listino da solo non dice quanto spendi, lo dice quanto di quell'input paghi dalla cache.
| Modello | Turno senza cache | Turno con 90% in cache | Rapporto |
|---|---|---|---|
| DeepSeek v4-pro ridotta | $0,068 | $0,011 | 6,4x |
| DeepSeek v4-pro piena | $0,136 | $0,021 | 6,4x |
| Gemini 2.5 Pro | $0,135 | $0,034 + affitto | 4,0x |
| Claude Sonnet 5 | $0,210 | $0,048 | 4,4x |
| OpenAI gpt-5.6-terra | $0,212 | $0,050 | 4,2x |
| Gemini 3.1 Pro | $0,212 | $0,050 + affitto | 4,2x |
Anthropic e OpenAI fanno pagare la cache a consumo: Anthropic una scrittura maggiorata (1,25x per cinque minuti, 2x per un'ora), OpenAI niente in scrittura e un decimo in rilettura. Google fa pagare anche lo stoccaggio: 4,50 dollari per milione di token, all'ora. Tenere 90K token in cache costa 0,40 dollari l'ora a prescindere da quante volte li leggi. Su una sessione fitta si spalma e non si sente; su un contesto grande che resta caldo fra una domanda e l'altra diventa la voce principale del conto.
Dai Claude 4.7 in poi, Sonnet 5 compreso, Anthropic usa un tokenizer nuovo che produce circa il 30% di token in più sullo stesso testo. Il confronto a listino qui sopra è per token, non per testo: su testo comparabile Sonnet 5 costa in pratica intorno a 2,60 in ingresso e 13 in uscita. L'esatto dipende dal contenuto, e va misurato sul proprio carico prima di ancorarci un preventivo.
La tariffa piena vale 01:00–04:00 e 06:00–10:00 UTC dal lunedì al venerdì, cioè 03:00–06:00 e 08:00–12:00 in Italia. È la fascia in cui si lavora: un carico interattivo europeo prende la tariffa piena quasi sempre, e la metà prezzo la vede solo il batch notturno. Un preventivo costruito sul prezzo ridotto sottostima di due volte.
Gemini 2.5 Pro passa da 1,25/10,00 a 2,50/15,00 quando il prompt supera i 200K token, e 3.1 Pro da 2,00/12,00 a 4,00/18,00. La soglia è sul singolo prompt, quindi un agente che accumula contesto ci sbatte contro a metà sessione e il costo per turno raddoppia senza che nulla nel codice sia cambiato. Anthropic tiene un prezzo unico su tutto il milione di token.
Il modello si chiama gemini-3.1-pro-preview. Per un confronto stabile con Sonnet 5 il termine di paragone difendibile resta 2.5 Pro, che è in disponibilità generale, ha il contesto dichiarato e il prezzo più basso dei due. Un listino di preview può cambiare al passaggio in GA.
Rilevato il 27 luglio e non riverificato oggi: quando una richiesta a un modello Regolo fallisce, l'API ripiega su un altro modello e risponde senza errore. Una chiamata a qwen3-coder-next è tornata con "model": "gpt-oss-20b". Il campo model della risposta è l'unico posto dove si vede, e va letto se il costo per token del modello servito conta.
I confronti qui sopra sono di listino. Questa sezione usa invece il consumo reale di un village agentico per un mese: 1,78 miliardi di token di contesto processati su 7 utenti, di cui il 91,5% riletto dalla cache, e 7,9 milioni di token di output. I dati vengono dai transcript reali, deduplicati per file e per identificativo del messaggio.
| Modello | Con cache | Senza cache | Quanto pesa la cache |
|---|---|---|---|
| OpenAI gpt-5.6-luna | $73 | $366 | 5,0x |
| DeepSeek v4-flash | $100 | $794 | 7,9x |
| Regolo qwen3.5-9b | — | $146 | non ha cache |
| DeepSeek v4-pro | $304 | $2.383 | 7,8x |
| Claude Haiku 4.5 | $389 | $1.821 | 4,7x |
| Gemini 2.5 Pro | $473 | $2.306 | 4,9x |
| OpenAI gpt-5.6-terra | $726 | $3.658 | 5,2x |
| Claude Sonnet 5 | $779 | $3.642 | 4,7x |
| Regolo qwen3.5-122b | — | $2.105 | non ha cache |
"Senza cache" è lo stesso identico carico pagato con tutto il contesto a prezzo di input pieno, che è la condizione reale di chi non ha prompt caching. La colonna vale sia come previsione per un provider senza cache, sia come misura di quanto si perde quando la cache non aggancia.
Anthropic fa pagare la scrittura più del prezzo di input (1,25x a cinque minuti, 2x a un'ora) e la rilettura un decimo. Su un carico che riscrive molto, la scrittura diventa la voce dominante. OpenAI, Gemini e DeepSeek non fanno pagare la scrittura come voce separata: il contesto nuovo entra a prezzo di input e la rilettura costa un decimo o meno. Regolo non espone la cache affatto, quindi ogni chiamata paga l'intero contesto a prezzo pieno: sul modello piccolo resta la spesa più bassa in assoluto, sul modello grande diventa la più alta.
Le due colonne qui sopra sono entrambe a consumo. C'è una terza famiglia che non guarda i token: un abbonamento (Claude Max 20x, intorno ai 200 dollari al mese) o ferro proprio (una macchina a due GPU da 24 GB, intorno ai 350 dollari al mese). In entrambi i casi il conto non si muove se il volume raddoppia.
Su questo carico il confronto si chiude da solo: lo stesso mese costa 779 dollari a consumo su Sonnet 5 e 200-350 a forfait. Il driver di costo di un village sono miliardi di token di contesto riletti, ed è esattamente la quantità che un forfait ignora e un contatore moltiplica.
Un abbonamento personale che regge il carico oggi non è una base di prezzo per un prodotto venduto a terzi: è legato a un account, ha limiti di frequenza propri, e non è pensato per fare da motore a un servizio multi-cliente. Chi progetta un canone per utente deve usare la colonna a consumo, non la bolletta che vede oggi. La differenza fra le due è di un ordine di grandezza, ed è il punto in cui un listino costruito sull'esperienza diretta diventa una vendita in perdita.
A listino i quattro provider stanno in una forbice stretta. Sull'output della fascia di lavoro Sonnet 5 e Gemini 2.5 Pro sono allineati a 10 dollari, OpenAI gpt-5.6-terra e Gemini 3.1 Pro a 12, e DeepSeek v4-pro sta sotto di due volte e mezzo. Sull'input Gemini 2.5 Pro è il più economico dei tre occidentali a 1,25 contro i 2,00 di Sonnet 5 e terra.
Con la cache accesa la classifica si comprime: fra Sonnet 5, terra e 3.1 Pro il turno da 100K costa fra 4,8 e 5,0 centesimi, cioè la stessa cifra. A quel punto il prezzo non è più il criterio di scelta, e decidono la qualità sul carico specifico, il tokenizer, la soglia dei 200K e dove finiscono i dati.
DeepSeek resta la metà di tutti anche con la cache. Regolo non compete sul prezzo assoluto e non ha cache: il suo argomento sono la latenza (inferenza in Italia) e il perimetro europeo dei dati. Se quei due fattori non pesano sul carico che hai in mano, il confronto si chiude sui numeri qui sopra.