Le AI si confrontano di solito per prezzo per token, parametri, finestra di contesto e punteggi nei benchmark. Sono misure utili ma parziali: descrivono il prodotto, non il lavoro. Il costo di un compito concluso con la qualità richiesta dipende anche da ragionamento, tentativi, controlli umani e integrazione. Per imprese, istituzioni e pubbliche amministrazioni il confronto utile parte dal costo per risultato verificato.
Indice degli argomenti
Una tabella che non risponde alla domanda
Un’azienda che vuole automatizzare l’assistenza ai clienti, un ospedale che deve riassumere cartelle, uno studio professionale che legge contratti, un comune che smista le istanze dei cittadini: chiunque debba scegliere a quale modello linguistico affidare un lavoro, comincia da una tabella. Sulle righe ci sono i modelli, sulle colonne il prezzo per milione di token in ingresso e in uscita, il numero di parametri, l’ampiezza della finestra di contesto, la velocità di generazione, il punteggio su qualche benchmark. Sono dati veri, confrontabili e facili da citare in una relazione, ed è per questo che sono diventati il linguaggio comune con cui si giudicano prestazioni e costi di un’intelligenza artificiale. Nessuna colonna, però, risponde alla domanda che chi decide si pone davvero: quanto mi costa avere, a fine mese, mille pratiche, richieste o documenti trattati correttamente?
Ogni metrica misura una cosa sola, e non sempre quella che interessa. Il token è l’unità in cui il fornitore fattura, non quella in cui l’organizzazione ottiene valore: dice quanto testo attraversa il modello, non quanto lavoro utile ne esce. Il numero di parametri descrive la dimensione del modello, non la sua capacità: già nel 2022 il modello Chinchilla, con 70 miliardi di parametri ma addestrato su molti più dati, superava Gopher, che ne aveva 280 miliardi [2]. La finestra di contesto indica quanto materiale si può fornire in una volta sola, non quanto bene il modello lo usi, e ogni pagina inserita si paga come token in ingresso. La velocità dice quanto presto arriva la risposta, non se è giusta. Un punteggio di benchmark, infine, fotografa un compito standard in condizioni controllate, che raramente somiglia a un processo reale, sia esso una pratica, un contratto o una richiesta di assistenza: per questo le valutazioni più rigorose, come HELM dell’Università di Stanford, misurano sette dimensioni, dall’accuratezza all’efficienza, e non una soltanto [1].
C’è poi un fatto che il listino nasconde. Negli ultimi anni una quota crescente del calcolo si è spostata dall’addestramento all’inferenza, cioè al momento in cui il modello risponde. Già nel 2024 alcuni ricercatori mostravano che, dedicando più calcolo alla risposta, un modello può battere uno fino a quattordici volte più grande [3]. Il vantaggio è reale, ma non è gratuito: si paga in token di ragionamento che l’utente non vede, in tentativi ripetuti, in passaggi intermedi che la fattura conteggia comunque.
Una valutazione più onesta deve dunque guardare a ciò che sta intorno al token. Al ragionamento, che può moltiplicare il consumo a parità di risposta. Ai tentativi: perché il costo di un risultato è il costo di ogni prova diviso per la probabilità che vada a buon fine. Alla qualità richiesta e al controllo umano, spesso la voce più pesante, insieme al costo degli errori che sfuggono alla verifica. All’integrazione con dati e sistemi esistenti, alla sicurezza, alla conformità, al monitoraggio e all’aggiornamento nel tempo. Sono voci che nessun listino riporta, e che decidono se un sistema convenga o no.
Tutto questo si riassume in un cambio di unità di misura. Non «quanto costa un milione di token?», ma «quanto costa un risultato che ha superato una verifica stabilita in anticipo?». Le pagine che seguono mostrano perché il prezzo unitario continua a scendere mentre il conto di un compito può salire, che cosa dicono i dati di settembre 2026, come si calcola il costo per risultato verificato e come imprese, istituzioni e pubbliche amministrazioni possono portarlo nei capitolati, nei bandi e nei contratti.
Il costo di una prestazione fissata continua a scendere
La discesa dei prezzi non è una novità. L’AI Index 2025 dell’Università di Stanford stimava che il costo di interrogare un sistema con prestazioni da GPT-3.5 fosse calato di oltre 280 volte tra novembre 2022 e ottobre 2024 [5]. Il 22 settembre 2026 Epoch AI ha aggiornato il quadro con un’analisi di Luke Emberson e David Roodman. Su cinque benchmark di matematica, scienze e giochi di abilità, gli autori stimano che dal 2023 il costo necessario per raggiungere un dato livello di prestazione sia sceso in media del 47% a trimestre, circa tredici volte l’anno. Il ritmo varia: più lento nei puzzle, più rapido nei problemi matematici. Il confronto storico colloca questa discesa a una velocità superiore a quella di altre tecnologie, con rapporti diversi a seconda del termine di paragone [4].
L’esempio più eloquente riguarda GPQA Diamond, un test a scelta multipla di scienze avanzate. Epoch stima che OpenAI o3, rilasciato nel gennaio 2025, raggiungesse il 75% di accuratezza a circa 30 centesimi di dollaro per domanda. Meno di diciotto mesi dopo, GPT-5.6 Luna avrebbe ottenuto lo stesso risultato a circa 0,0004 dollari: una riduzione stimata di 725 volte [4]. Va letto per quello che è, un confronto tra costi di inferenza stimati per una prestazione di benchmark, non tra tariffe d’API prese da sole; e non tra due servizi completi già integrati in azienda.
Gli stessi autori segnalano il limite principale: la curva descrive un utente ideale che sceglie ogni volta il modello meno costoso capace di raggiungere la prestazione desiderata, mentre le organizzazioni reali non cambiano modello a ogni uscita. Il dato risponde alla domanda «quanto costa oggi una prestazione già raggiunta in passato?», non a «quanto costa spingere oggi la frontiera?». La distinzione impedisce di trasformare un indicatore di efficienza storica in una promessa di risparmio per ogni acquirente.
Il costo della frontiera, invece, può salire
Se il prezzo di una prestazione già raggiunta crolla, quello dei modelli migliori racconta un’altra storia. Hans Gundlach, Jayson Lynch, Matthias Mertens e Neil Thompson, ricercatori legati a MIT FutureTech e MIT CSAIL, hanno incrociato risultati di benchmark e prezzi storici raccolti da Artificial Analysis ed Epoch AI. Nello studio The Price of Progress stimano che, nel periodo esaminato, raggiungere un livello dato di prestazione sia diventato da cinque a dieci volte meno costoso all’anno, con differenze tra prove e fasce di capacità [6].
La stessa analisi osserva però che il costo di eseguire i modelli migliori disponibili è aumentato, nelle prove considerate, di circa tre-diciotto volte l’anno. Non è una previsione universale né una misura aggiornata dei listini di settembre 2026: è una stima storica riferita a tre benchmark, GPQA Diamond, AIME e SWE-bench Verified. Gli autori associano inoltre una parte rilevante dei progressi su GPQA Diamond all’aumento della spesa di inferenza: a costo di benchmark controllato, la crescita della prestazione risulta circa la metà di quella suggerita dalla curva non corretta per il costo [6]. Da qui la loro raccomandazione a chi valuta i modelli: rendere pubblico, e tenere in conto, il prezzo dell’esecuzione dei benchmark.
Le due tendenze non si contraddicono. Il prezzo unitario può calare mentre cresce il numero di token o di operazioni necessario per guadagnare un miglioramento marginale. Se il costo per token si riducesse di dieci volte, ma il calcolo richiesto per guadagnare un punto di accuratezza aumentasse di cento volte, il costo complessivo di quella prestazione crescerebbe di dieci volte. Per chi acquista la conseguenza è concreta: modelli meno costosi raggiungono capacità un tempo riservate alla fascia alta, mentre usare il modello di punta con il ragionamento più intenso può restare oneroso.
Che cosa mostrano i benchmark di settembre 2026
Vediamo la differenza nei dati più recenti. Artificial Analysis pubblica un indice sintetico, l’Intelligence Index, che nella versione 4.3.2 combina dieci valutazioni. Il servizio calcola anche un costo medio per compito dell’indice, ricavato dai token usati nelle diverse prove e dai relativi prezzi. Sono stime di laboratorio utili per confrontare configurazioni e fornitori con un protocollo comune; non equivalgono al costo di una pratica amministrativa, di un ticket chiuso o di un documento accettato da un cliente [7].
La rilevazione consultata il 27 settembre offre un confronto istruttivo (Tabella 1). Claude Opus 5.5, al massimo livello di ragionamento, ottiene 58 punti e costa 5,98 dollari per compito. GPT-6 Astra, sempre al massimo livello, ne ottiene 53 e costa 3,26 dollari. Il listino di Opus 5.5 è di 4 dollari per milione di token in ingresso e 20 in uscita; quello di Astra è di 10 e 50. Nonostante il prezzo unitario più che doppio, Astra risulta meno costoso nel paniere di test perché consuma molti meno token di uscita. Il divario di consumo tra i modelli è comunque ampio: Opus 5.5 genera in media circa 119.000 token per compito, di cui circa 84.000 di ragionamento, contro i circa 31.000 di GPT-6 Sol, di cui circa 21.000 di ragionamento. Far girare l’intero indice costa circa 8.700 dollari con Opus 5.5, circa 1.550 con Sol e circa 122 con Luna [7].
Il listino, quindi, non permette di dedurre il costo di un lavoro senza conoscere il profilo di consumo. Ma anche questo confronto va letto con prudenza: un punteggio più alto e un costo medio inferiore nell’indice non provano che Astra sia più conveniente per ogni uso aziendale. Il risultato cambia con la natura del compito, i dati forniti, le soglie di errore, il numero di tentativi e l’eventuale revisione umana.
La fascia economica offre un esempio analogo. Artificial Analysis ha rilevato che Gemini 3.8 Flash, con ragionamento alto, costa 0,58 dollari per compito dell’indice, circa il 40% in più della versione precedente, pur mantenendo invariato il prezzo per token. La società attribuisce la differenza a circa il 30% di token d’uscita in più, arrivati a 48.000 per compito, e a un maggior numero di turni nelle valutazioni agentiche; il punteggio, nel frattempo, è salito di tre punti [8]. Il dato riguarda quella configurazione e quel benchmark: non autorizza a concludere che il servizio costi il 40% in più per qualsiasi richiesta.
Tabella 1. Confronto di modelli nell’Artificial Analysis Intelligence Index v4.3.2
| Modello e sforzo | Prezzo API per 1M token input / output | Punteggio indice | Token di output per compito | Costo per compito dell’indice |
| Claude Opus 5.5 max | $4 / $20 | 58 | circa 119.000 | $5,98 |
| GPT-6 Astra max | $10 / $50 | 53 | n.d. | $3,26 |
| GPT-6 Sol max | $2 / $10 | 48 | circa 31.000 | $1,06 |
| GPT-6 Luna max | $0,10 / $0,50 | 37 | circa 51.000 | $0,07 |
Fonte: Artificial Analysis, rilevazione consultata il 27 settembre 2026 [7]. Il costo per compito è la media ponderata delle dieci valutazioni dell’indice, non il costo di un compito operativo dell’organizzazione. n.d.: dato non riportato nelle pagine consultate.
La manopola del ragionamento, la cache e la scelta del modello
Il livello di ragionamento è una variabile economica, oltre che tecnica. Nella stessa rilevazione, per Opus 5.5 il costo per compito va da circa 0,55 dollari con sforzo basso a 5,98 con sforzo massimo, mentre il punteggio passa da 42 a 58. Per GPT-6 Astra il costo sale da circa 0,82 a 3,26 dollari e il punteggio aumenta di sette punti [7]. Sono cifre che descrivono l’indice e la rilevazione considerati, non una tariffa universale per ogni richiesta, ma raccontano bene la natura dello scambio: gli ultimi punti di qualità costano molto più dei primi.
In un sistema reale la scelta dello sforzo dovrebbe dipendere dalla classe di attività. Il riassunto di una comunicazione aziendale standard non richiede lo stesso budget di ragionamento di un’analisi contrattuale, o di una pratica con conseguenze economiche. Se il livello resta fisso al massimo per tutte le richieste, si paga capacità inutilizzata; se è fissato troppo in basso, aumentano gli errori e i controlli successivi. Lo stesso vale per la scelta del modello: la ricerca sulle architetture a cascata, come FrugalGPT, ha mostrato che instradare ogni richiesta verso il modello meno costoso capace di risolverla può ridurre la spesa anche in modo drastico, fino al 98% in alcune condizioni sperimentali, a parità di prestazione [10]. È un risultato di laboratorio, ma indica dove cercare il risparmio.
Anche la cache dei prompt può modificare il conto. Se l’applicazione invia ripetutamente lo stesso regolamento, manuale o contesto di sistema, i token già memorizzati possono ricevere tariffe ridotte. Le condizioni dipendono dal fornitore, dal modello, dalla durata della cache e dalla configurazione: per alcuni servizi lo sconto sui token letti dalla cache arriva al 90%, ma la scrittura della cache può avere un costo e non tutte le richieste producono un riuso effettivo [9]. Il risparmio va misurato sui log, non presunto dal listino.
Dal costo per compito al costo per risultato verificato
Nemmeno il costo per compito coincide ancora con il costo di un risultato corretto. Un modello che costa poco per tentativo, ma supera raramente la soglia di qualità, può richiedere più chiamate e più lavoro umano. Un articolo di ricerca presentato a ICLR 2026 formalizza questa idea nel cost-of-pass, il costo atteso per ottenere una soluzione corretta, che combina costo di inferenza e probabilità di successo [11]. In una formula semplificata, se ogni tentativo costa C e la probabilità di superare la verifica è p, il costo atteso di inferenza per un risultato corretto è C/p, assumendo tentativi indipendenti e una strategia di ripetizione definita. Un tentativo da un centesimo che riesce una volta su cinque costa, in realtà, cinque centesimi per ogni risultato buono.
Per un’organizzazione serve un calcolo più ampio: costo di inferenza, chiamate agli strumenti, recupero dei dati, controlli umani, correzioni e quota attribuibile di integrazione e manutenzione, divisi per il numero di risultati che superano i criteri di accettazione. Il lavoro umano va misurato sul flusso completo. Se la persona deve rileggere ogni risposta da zero, il sistema può non ridurre il costo anche quando il modello è economico; se il controllo è breve e intercetta errori rari ma costosi, il valore può essere alto.
Questa misura non ha un numero valido per tutti. Dipende dai dati dell’organizzazione, dalla frequenza e dalla gravità degli errori, dalla soglia di qualità e dal processo in cui il sistema viene inserito. I benchmark pubblici possono restringere la scelta, ma non sostituiscono un test sui casi reali e rappresentativi, con criteri di valutazione fissati prima della prova.
Come cambiare acquisti, capitolati e contratti
Il principio vale per chiunque acquisti o sviluppi sistemi di IA: un’impresa che sceglie un fornitore, un ente di ricerca, una fondazione, un’amministrazione che indice una gara. Le istituzioni pubbliche stanno del resto cominciando a ragionare in termini di ciclo di vita. In Italia le bozze AgID per lo sviluppo e per il procurement di sistemi di IA nella pubblica amministrazione, adottate per la consultazione con Determinazione n. 43 del 10 marzo 2026, sono rimaste in consultazione pubblica dal 12 marzo all’11 aprile; l’iter di adozione risulta ancora in corso alla fine di settembre. La bozza sul procurement invita a valutare le soluzioni sull’intero ciclo di vita, non sul solo prezzo di acquisto, e richiama il LCOAI come strumento di comparazione e supporto alla decisione, non come automatismo per aggiudicare una gara. Non sembra invece entrare nel dettaglio dei costi a consumo, come quelli a token [12]. È un buon punto di partenza, che ogni organizzazione può completare con la misura proposta qui di seguito.
Prima di scegliere, l’organizzazione, qualunque sia la sua natura, può costruire un insieme riservato di casi tratti dai propri flussi, anonimizzati quando necessario, con risposte di riferimento e criteri di qualità fissati in anticipo. Nel capitolato, nella richiesta di offerta o nel contratto di fornitura i fornitori dovrebbero dichiarare modello e versione, impostazione di ragionamento, consumo per tipo di token, numero di chiamate a strumenti, tasso di superamento dei controlli, tempi e quota di lavoro umano richiesta.
Un test riservato riduce il rischio che un fornitore ottimizzi la soluzione su esempi pubblici già noti, ma non garantisce da solo una prova imparziale: il campione deve rappresentare anche casi rari, eccezioni e input difficili. Occorre stabilire come si gestiscono aggiornamenti del modello, dati mancanti, allucinazioni, errori gravi e risultati contestati. Le prove vanno ripetute su un insieme separato, per non confondere l’ottimizzazione sul test con una migliore prestazione generale.
Il contratto può fissare budget o soglie di consumo per classi di compito, senza imporre un unico livello di ragionamento. Può inoltre collegare una parte del corrispettivo a unità di risultato accettate, purché siano definiti in modo verificabile i criteri di accettazione e la responsabilità per errori o indisponibilità. Una tariffa per pratica, ticket o documento «chiuso» trasferisce rischio al fornitore soltanto se il risultato, la qualità e le eccezioni sono definiti con precisione; altrimenti sposta la controversia dal consumo dei token alla valutazione del risultato.
Infine, i contratti dovrebbero consentire verifiche periodiche di prezzo e prestazioni, accesso ai dati di consumo, sostituzione del modello e portabilità dell’orchestrazione. La discesa storica del costo per una prestazione fissata è un buon motivo per negoziare trasparenza e possibilità di migrare. Non basta però per concludere che ogni prezzo bloccato sia sconveniente: continuità del servizio, sicurezza, assistenza, integrazione, qualità e costi di migrazione incidono sul valore complessivo. La clausola utile lega la revisione a metriche verificabili e a condizioni di uscita praticabili.
La domanda da fare
Il prezzo per token resta un dato necessario per il budget, ma è insufficiente per scegliere un sistema, così come il numero di parametri, la finestra di contesto o un punteggio di benchmark. La misura più utile è il costo per risultato che supera criteri di qualità concordati, calcolato sul processo reale e comprensivo dei controlli umani e delle correzioni.
I benchmark aiutano a selezionare i candidati; un pilota rappresentativo dice se il sistema conviene davvero all’organizzazione.
Chi deve decidere, in un’azienda come in un ospedale, in un ministero come in un comune, non dovrebbe chiedersi «quanto costa un milione di token?». Dovrebbe chiedersi «quanto costa completare correttamente questo lavoro, con quali errori, in quanto tempo e con quanta supervisione?». È su questa unità che imprese, istituzioni e amministrazioni possono confrontare modelli, fornitori e architetture senza scambiare una tariffa più bassa per un risparmio effettivo.
Fonti e riferimenti
[1] Percy Liang, Rishi Bommasani, Tony Lee e altri, Holistic Evaluation of Language Models, Transactions on Machine Learning Research, 2023. Valutazione su sette dimensioni, tra cui accuratezza ed efficienza. https://arxiv.org/abs/2211.09110
[2] Jordan Hoffmann, Sebastian Borgeaud, Arthur Mensch e altri, Training Compute-Optimal Large Language Models, DeepMind, 2022. Chinchilla (70 miliardi di parametri) e Gopher (280 miliardi). https://arxiv.org/abs/2203.15556
[3] Charlie Snell, Jaehoon Lee, Kelvin Xu e Aviral Kumar, Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters, 2024. https://arxiv.org/abs/2408.03314
[4] Luke Emberson e David Roodman, Epoch AI, The plunging price of thought, 22 settembre 2026. Dati su riduzione trimestrale, confronto storico e costo sul benchmark GPQA Diamond. https://epoch.ai/publications/the-plunging-price-of-thought
[5] Stanford Institute for Human-Centered AI, Artificial Intelligence Index Report 2025, aprile 2025. Riduzione del costo di inferenza a parità di prestazione (livello GPT-3.5), novembre 2022 – ottobre 2024. https://hai.stanford.edu/ai-index/2025-ai-index-report
[6] Hans Gundlach, Jayson Lynch, Matthias Mertens e Neil Thompson, The Price of Progress: Price Performance and the Future of AI, MIT FutureTech, arXiv, 2025. Dati di Artificial Analysis ed Epoch AI; prezzi di esecuzione dei benchmark, spesa di inferenza e frontiera. https://arxiv.org/abs/2511.23455
[7] Artificial Analysis, confronto Claude Opus 5.5, GPT-6 Sol e GPT-6 Luna, e scheda GPT-6 Astra, Intelligence Index v4.3.2, consultati il 27 settembre 2026. https://artificialanalysis.ai/models/comparisons/gpt-6-sol-vs-gpt-6-luna-vs-claude-opus-5-5 ; https://artificialanalysis.ai/models/gpt-6-astra
[8] Artificial Analysis, Gemini 3.8 Flash, dati di costo per compito e token di output. https://artificialanalysis.ai/articles/gemini-3-8-flash
[9] Documentazione ufficiale sui prezzi di prompt caching: OpenAI https://developers.openai.com/api/docs/guides/prompt-caching ; Anthropic https://platform.claude.com/docs/en/build-with-claude/prompt-caching ; Google Cloud https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/context-cache/context-cache-overview
[10] Lingjiao Chen, Matei Zaharia e James Zou, FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance, 2023. https://arxiv.org/abs/2305.05176
[11] Mehmet Hamza Erol, Batu El, Mirac Suzgun, Mert Yuksekgonul e James Zou, Cost-of-Pass: An Economic Framework for Evaluating Language Models, ICLR 2026. https://arxiv.org/abs/2504.13359
[12] AgID, Determinazione del Direttore Generale n. 43 del 10 marzo 2026 e documenti di consultazione; consultazione dal 12 marzo all’11 aprile 2026. Bozza procurement: https://www.agid.gov.it/sites/agid/files/2026-03/LLGG%20procurement_per%20consultazione%20pubblica.pdf . Stato del percorso: https://www.agid.gov.it/it/ambiti-intervento/intelligenza-artificiale



























Partecipa alla community