Un token è circa tre quarti di una parola inglese, ha spiegato la stessa pagina dei prezzi di OpenAI nel 2022, subito dopo aver notato che una frase di 35 token costa una frazione di un centesimo. Questa struttura sopravvive a malapena al contatto con il 2026: i modelli più piccoli ora costano una frazione di centesimo per token, il più grande costa cinquanta dollari per milione di token di output e tre fornitori – OpenAI, Anthropic e DeepSeek – hanno tagliato, aumentato, diviso e ri-spartito i loro prezzi più volte. Ogni figura seguente proviene da una pagina che abbiamo recuperato: la pagina dei prezzi attuali del fornitore o un'istantanea dell'archivio Internet della stessa pagina dalla data mostrata. Quando calcoliamo un rapporto, entrambi i numeri da cui è costruito sono citati nello stesso paragrafo.
OpenAI, dal 2022 al 2026
Nel novembre 2022, la pagina dei prezzi di OpenAI elencava quattro modelli base, Ada, Babbage, Curie e Davinci, ciascuno con lo stesso prezzo per ogni token, indipendentemente dal fatto che fosse prompt o output: non c'era ancora alcuna divisione input/output. Davinci, il più capace dei quattro, costa $ 0,02 per 1.000 token. L'attuale pagina di deprecazione di OpenAI conferma in modo indipendente quella cifra esatta, $ 20,00 per milione di token, come prezzo al quale text-davinci-003 - il modello specifico costruito su quel livello - è stato fatturato fino alla sua chiusura nel 2024. Quattro mesi dopo, GPT-4 è stato lanciato a 0,03 dollari per 1.000 token di richiesta e 0,06 dollari per 1.000 token di completamento per la sua versione in contesto 8K, raddoppiando a 0,06 dollari e 0,12 dollari per la versione 32K: la prima volta che i prezzi pubblici di OpenAI addebitano ai token di output più dei token di input. gpt-3.5-turbo è stato lanciato lo stesso mese a un prezzo fisso di 0,002 dollari per 1.000 token, sempre senza suddivisione input/output.
| Modello | Inserisci $/1 milione | Produzione $/1 milione | Prezzo a partire da | Fonte |
|---|---|---|---|---|
| testo-davinci-003 | $ 20,00 | $ 20,00 | Novembre 2022 | pagina dei prezzi archiviata |
| gpt-3.5-turbo (lancio) | $ 2,00 | $ 2,00 | Marzo 2023 | pagina dei prezzi archiviata |
| Contesto GPT-4, 8K (lancio) | $ 30,00 | $ 60,00 | Marzo 2023 | pagina dei prezzi archiviata |
| gpt-4o-2024-05-13 (lancio) | $ 5,00 | $ 15,00 | Maggio 2024 | Documenti sui prezzi OpenAI |
| o1 (ragionamento) | $ 15,00 | $ 60,00 | elenco attuale | Documenti sui prezzi OpenAI |
| gpt-4o (prezzo attuale) | $ 2,50 | $ 10,00 | attuale | Documenti sui prezzi OpenAI |
| gpt-6-luna (corrente più economica) | $ 0,10 | $ 0,50 | attuale | Documenti sui prezzi OpenAI |
| gpt-6-astra (attuale ammiraglia) | $ 10,00 | $ 50,00 | attuale | Documenti sui prezzi OpenAI |
Due confronti, entrambi costruiti solo dalle righe sopra: il prezzo di input di $ 20,00 di text-davinci-003 rispetto agli attuali $ 0,10 di gpt-6-luna è un calo di 200 volte in circa quattro anni, per il livello più economico disponibile di OpenAI in ogni momento. Ma il prezzo di input originale di $ 30,00 di GPT-4 rispetto agli attuali $ 10,00 di gpt-6-astra è solo un calo di 3 volte per un confronto tra flagship: il livello economico è caduto molto più velocemente di quello costoso. Lo stesso gpt-4o è stato rivalutato al ribasso dopo il lancio, da $ 5,00/$ 15,00 nel maggio 2024 a $ 2,50/$ 10,00 oggi, un semplice caso in cui lo stesso modello è diventato più economico senza modificare affatto la sua capacità.
Antropico, dal 2023 al 2026
Il primo foglio dei prezzi per sviluppatori di Anthropic che siamo riusciti a recuperare, un PDF archiviato del luglio 2023, valutava Claude 2, lanciato quello stesso mese, a 11,02 dollari per milione di token di input e 32,68 dollari per milione di token di output, e notava che Claude 1 rimaneva disponibile allo stesso prezzo. Claude Instant, il livello più economico all’epoca, aveva un input di $ 1,63 e un output di $ 5,51. All’inizio del 2024, prima della spedizione di Claude 3, un’istantanea archiviata mostra Claude 2.0 e 2.1 tagliati a $ 8,00/$ 24,00 e Instant tagliato a $ 0,80/$ 2,40: modeste riduzioni sulla gamma esistente. Claude 3, lanciato nel marzo 2024, ha ripristinato completamente il fondo dell'intervallo: Haiku è arrivato a $ 0,25/$ 1,25, ben al di sotto di qualsiasi cosa Anthropic avesse offerto prima, mentre Sonnet e Opus sono stati lanciati a $ 3,00/$ 15,00 e $ 15,00/$ 75,00. Claude 3.5 Sonnet, tre mesi dopo, è stato lanciato esattamente agli stessi $ 3,00/$ 15,00 di Claude 3 Sonnet: un caso in cui il prezzo è rimasto stabile mentre il modello stesso è migliorato.
| Modello | Inserisci $/1 milione | Produzione $/1 milione | Prezzo a partire da | Fonte |
|---|---|---|---|---|
| Claude 1 / Claude 2 (stesso prezzo) | $ 11,02 | $ 32,68 | Luglio 2023 | PDF dei prezzi archiviato |
| Claudio Istantaneo | $ 1,63 | $ 5,51 | Luglio 2023 | PDF dei prezzi archiviato |
| Claude 2.0 / 2.1 (dopo la riduzione del prezzo) | $ 8,00 | $ 24,00 | Febbraio 2024 | PDF dei prezzi archiviato |
| Claude 3 Haiku (lancio) | $ 0,25 | $ 1,25 | Marzo 2024 | pagina API archiviata |
| Claude 3 Sonetto (lancio) | $ 3,00 | $ 15,00 | Marzo 2024 | pagina API archiviata |
| Claude 3 Opus (lancio) | $ 15,00 | $ 75,00 | Marzo 2024 | pagina API archiviata |
| Claude 3.5 Sonetto (lancio) | $ 3,00 | $ 15,00 | Giugno 2024 | istantanea dei prezzi archiviata |
| Haiku 4.5 (attualmente il più economico) | $ 1,00 | $ 5,00 | attuale | I prezzi di Claudio |
| Sonetto 5 (attuale) | $ 2,00 | $ 10,00 | attuale | I prezzi di Claudio |
| Fable 5.1 (attuale fiore all'occhiello) | $ 10,00 | $ 50,00 | attuale | I prezzi di Claudio |
Qui la curva non cade semplicemente. Claude 3 Haiku è stato lanciato con un input di $ 0,25 nel marzo 2024; L’attuale modello più economico di Anthropic, Haiku 4.5, costa $ 1,00: quattro volte più costoso, per token, rispetto al livello economico di due anni prima. Da solo, sembra che l’intelligenza artificiale sia diventata più costosa. Leggi accanto al resto di questo articolo, sembra qualcos'altro: Anthropic ha mantenuto il prezzo per token del livello più basso all'incirca piatto o leggermente in aumento, rendendo quel livello molto più capace, e ha anche aggiunto un nuovo livello di punta più costoso (Fable 5.1 a $ 10,00/$ 50,00) al di sopra di quello che Opus era il massimo. La formazione è cresciuta di più livelli invece di diventare uniformemente più economica.
DeepSeek e il ragionamento-shock dei prezzi
DeepSeek è entrato in questo mercato già a un prezzo molto inferiore ai suoi due rivali. Nel maggio 2024, la sua pagina dei prezzi archiviata mostra deepseek-chat, supportata da DeepSeek-V2, con un input fisso di $ 0,14 e un output di $ 0,28: più economico di qualsiasi cosa OpenAI o Anthropic offrissero all'epoca, prima che entrambi avessero spedito un token più economico di $ 0,25. Entro dicembre 2024, deepseek-chat è stato aggiornato a DeepSeek-V3 e la pagina dei prezzi di DeepSeek ha introdotto una suddivisione cache-hit/cache-miss: uno snapshot archiviato mostra la tariffa standard (post-promozione) a $ 0,07 di input di cache-hit, $ 0,27 di input di cache-miss e $ 1,10 di output. Quindi, il 20 gennaio 2025, DeepSeek ha rilasciato R1, un modello di ragionamento, con un input di successo nella cache di 0,14 dollari, un input di successo nella cache di 0,55 dollari e un output di 2,19 dollari: uno snapshot archiviato di otto giorni dopo conferma quel prezzo, esplicitamente escluso da qualsiasi sconto promozionale.
| Modello | Ingresso $/1 milione (cache hit/cache miss) | Produzione $/1 milione | Prezzo a partire da | Fonte |
|---|---|---|---|---|
| DeepSeek-V2 (chat di deepseek) | piatto $ 0,14 | $ 0,28 | Maggio 2024 | pagina dei prezzi archiviata |
| DeepSeek-V3 (chat deepseek, tariffa standard) | $ 0,07 / $ 0,27 | $ 1,10 | dicembre 2024 | pagina dei prezzi archiviata |
| DeepSeek-R1 (deepseek-ragionatore, lancio) | $ 0,14 / $ 0,55 | $ 2,19 | Gennaio 2025 | pagina dei prezzi archiviata |
| deepseek-flash (attuale, non di punta) | $ 0,003 / $ 0,15 | $ 0,60 | attuale | Documenti sui prezzi di DeepSeek |
| deepseek-v4-pro (attuale, non di punta) | $ 0,022 / $ 0,66 | $ 1,98 | attuale | Documenti sui prezzi di DeepSeek |
Il lancio di R1 è il numero più significativo dell'intero articolo: un output di 2,19 dollari contro o1 di OpenAI, un modello di ragionamento comparabile, con un output di 60,00 dollari: un divario di 27 volte, entrambi i dati delle tabelle sopra. Questo confronto è esattamente ciò che ha reso R1 una storia oltre il solito pubblico di sviluppatori nel gennaio 2025. Vale anche la pena notare cosa dicono i numeri di DeepSeek sul ragionamento specifico: il prezzo di uscita di 2,19 dollari di R1 è circa il doppio di 1,10 dollari di V3, all’interno dello stesso fornitore, nello stesso momento. Il ragionamento basato sulla catena di pensiero non si limita ad aggiungere un moltiplicatore di costo a livello API; La documentazione di DeepSeek rileva che il conteggio dei token di output di un modello di ragionamento include ogni token della sua traccia di ragionamento, non solo la risposta finale, quindi una query di ragionamento brucia molti più token di output rispetto a una diretta anche prima che venga applicato il prezzo per token. E i prezzi attuali di DeepSeek aggiungono un meccanismo che nessun altro fornitore utilizza: le tariffe nelle ore di punta raddoppiano all’incirca le tariffe nelle ore non di punta sullo stesso modello, una forma di prezzo basato sulla domanda più vicino alla fatturazione dell’elettricità che a un listino prezzi fisso.
Lo schema nascosto dai numeri piatti
Metti le cifre dei token più economici disponibili dei tre fornitori su una sequenza temporale e la forma non è una curva regolare. Il livello economico di OpenAI è sceso da $ 20,00 (novembre 2022) a $ 0,10 oggi, essenzialmente in modo monotono. Il livello economico di Anthropic è crollato duramente una volta, da $ 1,63 (2023, Claude Instant) a $ 0,25 (marzo 2024, Claude 3 Haiku), per poi risalire a $ 1,00 (attuale, Haiku 4.5) man mano che quel livello è diventato più capace. DeepSeek è entrato già a buon mercato ed è rimasto lì, aggiungendo al contempo i prezzi in base all'ora del giorno. Nessuna delle curve dei tre fornitori si assomiglia, e nessuna di esse sembra un semplice declino esponenziale una volta che si tiene traccia di un livello specifico piuttosto che di "qualunque sia il nome del modello più economico quest'anno".
L’output costa più dell’input e il rapporto si è ampliato
Al lancio di GPT-4 nel marzo 2023, l’output costava esattamente il doppio dell’input: $ 60,00 contro $ 30,00. Considerando gli attuali modelli di punta e di fascia media di tutti e tre i fornitori, il rapporto si è ampliato: gpt-6-astra è 5x (50,00 $ contro 10,00 $), Claude 3 Opus è stato lanciato a 5x (75,00 $ contro 15,00 $) e vi è rimasto fino a Haiku 4.5 (5x, 5,00 $ contro 1,00 $) e la tariffa standard di DeepSeek-V3 è circa 4x. ($ 1,10 contro $ 0,27 per cache mancata). La solita spiegazione tecnica è architettonica piuttosto che commerciale: la generazione di token di output avviene uno alla volta, in modo autoregressivo, mentre i token di input di un prompt possono essere elaborati in parallelo in un singolo passaggio in avanti, quindi il costo di elaborazione effettivo di un provider per token di output è superiore a quello per token di input, e i prezzi si sono spostati nel riflettere tale divario in modo più accurato nel tempo rispetto alla suddivisione 2x originale e più rotonda di GPT-4.
Sconti cache e batch
Tutti e tre i fornitori ora scontano i token che il modello ha già effettivamente visto. L'attuale pagina dei prezzi di OpenAI elenca l'input memorizzato nella cache di gpt-6-astra a $ 1,00 contro una tariffa di input standard di $ 10,00, uno sconto 10 volte per riutilizzare un prefisso di richiesta identico e afferma separatamente che la sua API Batch elabora le richieste entro una finestra di 24 ore alla metà del prezzo sincrono standard tra i modelli idonei. Il prezzo attuale di Anthropic mostra il prezzo di lettura del prompt-caching di Fable 5.1 a $ 0,25 contro una tariffa di input standard di $ 10,00 - 40 volte più economica - mentre una scrittura nella cache costa $ 12,50, un premio rispetto alla tariffa standard di $ 10,00, poiché scrivere una nuova voce nella cache fa un vero lavoro extra la prima volta. La suddivisione cache-hit/cache-miss di DeepSeek, descritta sopra, è incorporata nel suo prezzo base piuttosto che offerta come funzionalità separata: il tasso di cache-hit/cache-miss di R1 di $ 0,14 contro il suo tasso di cache-miss di $ 0,55 è una differenza di circa 4 volte su ogni singola chiamata, non solo sulle richieste che accettano. Per qualsiasi carico di lavoro che ripete un lungo prompt di sistema o un insieme fisso di definizioni di strumenti su molte chiamate, una pipeline di triage di sicurezza che classifica una riga di registro dopo l'altra rispetto alle stesse istruzioni è un chiaro esempio: questi sconti cambiano quale fornitore è più economico più di quanto non faccia il prezzo principale per token.
Il paradosso di Jevons: perché i token più economici hanno aumentato la spesa totale
Nel 1865, l’economista William Stanley Jevons pubblicò The Coal Question, sostenendo che il consumo di carbone della Gran Bretagna era aumentato, e non diminuito, dopo che il motore a vapore più efficiente in termini di carburante di James Watt aveva reso più economico il lavoro alimentato a carbone. Come si legge nel riassunto dell’argomento di Wikipedia, citando direttamente Jevons:
È una confusione di idee supporre che l'uso parsimonioso del carburante equivalga a una diminuzione dei consumi. La verità è proprio il contrario.
William Stanley Jevons, 1865, as quoted in Wikipedia: Jevons paradox
L’argomentazione, poiché generalizzata ben oltre il carbone, è che rendere una risorsa più efficiente da utilizzare ne abbassa il prezzo effettivo, e un prezzo più basso aumenta la quantità domandata più di quanto il guadagno di efficienza fa risparmiare – quindi il consumo totale aumenta. Secondo lo stesso riassunto di Wikipedia, questo esatto argomento è stato ampiamente invocato all’inizio del 2025 attorno al modello economico R1 di DeepSeek, con commentatori tra cui il CEO di Microsoft Satya Nadella e l’economista Erik Brynjolfsson che discutevano se un’inferenza dell’intelligenza artificiale radicalmente più economica avrebbe ridotto o aumentato le risorse totali spese per l’intelligenza artificiale. Ci affidiamo qui a quella sintesi secondaria di commenti nominati piuttosto che a uno studio economico primario che misura l’effetto aggregato, e l’affermazione che la spesa per l’intelligenza artificiale a livello di settore sta aumentando a causa di token più economici – piuttosto che nonostante un boom della domanda separato e non correlato – è un’interpretazione dibattuta, non una statistica consolidata. Ciò che le tabelle dei prezzi sopra supportano direttamente è il presupposto per l’argomentazione: la stessa query che costava decine di dollari in termini di calcolo nel 2022 può costare centesimi oggi, a ogni fornitore, che è esattamente il tipo di crollo dei prezzi che storicamente ha preceduto l’aumento dei consumi anziché il calo.
Cosa significa questo per l'esecuzione dell'intelligenza artificiale localmente anziché nel cloud
Ogni prezzo in questo articolo è un costo misurato per chiamata fatturato da un'azienda che riceve necessariamente la tua richiesta di risposta: ecco cos'è una chiamata API. Un modello che viene eseguito interamente sul tuo dispositivo non ha alcuna fattura per token dopo averlo pagato o scaricato una volta e non ha nulla da inviare da nessuna parte, perché non è presente alcun endpoint remoto nel percorso della richiesta. Ciò non significa che i modelli su dispositivo corrispondano ai livelli di frontiera sopra indicati; un modello abbastanza piccolo da poter essere eseguito comodamente su un laptop non sarà fuori ragione Fable 5.1 o gpt-6-astra. È un mestiere diverso: un costo fisso e un limite fermo di privacy, in cambio di qualunque capacità si adatti alla memoria che effettivamente possiedi.
Questo compromesso non è astratto; è lo stesso che un modello su dispositivo piccolo e con ambito ristretto crea all'interno di un software di sicurezza. FireAI, il firewall per Mac di HisnLabs, fornisce un modello locale opzionale il cui unico compito è rivedere una connessione da un'app per la quale non dispone ancora di una regola: un'attività con una portata molto più ridotta rispetto a qualsiasi cosa indicata nelle tabelle sopra e in cui il modello viene eseguito sul Mac stesso anziché chiamare una qualsiasi di queste API. Lo scopo di esaminare la cronologia dei prezzi di OpenAI, Anthropic e DeepSeek in modo così dettagliato non è quello di vendere quel design; è rendere concreto il commercio: i token cloud hanno acquistato molta più capacità per molto meno denaro tra il 2022 e il 2026, e a ognuno di questi prezzi, utilizzarli significava comunque inviare i propri dati al server di qualcun altro per ottenere una risposta.
Il ruolo di FireAI e di HisnLabs
None of this makes FireAI a cost story — it is a firewall, not a rented model — but the same bet sits underneath its own on-device reviewer: no per-token bill and nothing sent off the Mac, because the review happens locally instead of being shipped to a server.
FireAI è il prodotto di HisnLabs: un firewall con IA che funziona direttamente sul Mac. Mostra in linguaggio chiaro ogni connessione che le tue app effettuano e ti lascia decidere cosa esce dal tuo Mac — la sua IA lavora in locale, quindi il tuo traffico non viene mai inviato a noi né a nessun altro. Il team di ricerca sulla sicurezza di HisnLabs è quello che mantiene affidabili queste decisioni: cataloga quali domini sono semplice telemetria e quali un servizio reale, traccia il Paese e la rete dietro una connessione e addestra il modello locale (la funzione Autopilot) su schemi di traffico reali, senza che nulla lasci il tuo Mac.
Puoi leggere le scelte tecniche che ci stanno dietro, oppure provare FireAI per 17 giorni, su FireAI, di HisnLabs.
