Nel sempre più serrato dibattito sulla trasparenza dei sistemi generativi di ultima generazione, la visibilità del processo di calcolo ha spesso fornito una falsa sensazione di controllo negli utilizzatori di tale tecnologia. Negli ultimi due anni, vi è stata la progressiva introduzione dei modelli orientati al ragionamento complesso (altresì conosciuti come “reasoning models”) progettati per elaborare un problema suddividendolo in passaggi logici intermedi prima di generare una risposta definitiva. Tale entrata in scena è stata accompagnata dalla diffusione capillare della “Chain of Thought”, quella sequenza di passaggi logici intermedi mostrata a schermo all’utente prima di fornirgli una risposta.
Questo tracciato è stato a lungo considerato dagli sviluppatori (e dai “comuni” utenti) come una finestra d’osservazione diretta sulla logica interna dell’algoritmo. L’evidenza scientifica e i recenti sviluppi industriali indicano tuttavia un quadro più articolato che vede la traccia visibile rappresentare, in realtà, una sintesi testuale generata “a posteriori” e non, come potremmo umanamente pensare, la registrazione in tempo reale delle attivazioni neuronali sottostanti.
Indice degli argomenti
Chain of Thought e trasparenza dell’IA: lo scarto dal calcolo reale
Il problema dello scarto tra la narrazione in lingua naturale e l’effettivo calcolo vettoriale sta assumendo una rilevanza centrale con l’avanzare delle capacità dei modelli. Nel momento in cui i token intermedi (ossia i passaggi logici interni all’IA) vengono lasciati “liberi di evolvere” per ottimizzare le prestazioni, l’attività computazionale profonda tende a distaccarsi dalle regole sintattiche umane, rendendo il tracciamento dei comportamenti (anomali o rischiosi) un compito significativamente più complesso.
Dall’interfaccia al calcolo vettoriale
Per comprendere la natura del problema è necessario distinguere il livello dell’interfaccia (ciò che noi esseri umani vediamo) da quello dell’elaborazione matematica (quello che “pensa” la macchina). Quando un sistema affronta un problema articolato, i calcoli avvengono all’interno di uno spazio vettoriale ad altissima dimensione mediante la ponderazione di diversi valori. La sequenza di testo espressa nella Chain of Thought è una narrazione secondaria che il modello produce per soddisfare i criteri di chiarezza imposti in fase di addestramento.
E questa curiosa dinamica trova riscontro nelle ricerche condotte sia da laboratori commerciali sia da istituti indipendenti. Gli studi pubblicati dai ricercatori di Anthropic, tra cui un elaborato dell’anno scorso[1], mostrano come i modelli tendano frequentemente a determinare l’esito del calcolo già nei primi strati di elaborazione implicita. Infatti, soltanto successivamente la macchina genera una spiegazione ordinata, costruita per giustificare la risposta finale. D’altro canto, non potrebbe essere diversamente, dato che le funzioni di ottimizzazione adottate nell’addestramento IA premiano il sistema per l’esattezza della risposta e la leggibilità dell’output, non per la fedeltà causale del resoconto visibile rispetto alle operazioni vettoriali sottostanti.
La falsa fiducia nella trasparenza dei modelli IA
E ancora più curioso e, spesso, paradossale è l’effetto sulle persone. Alcune ricerche hanno dimostrato che la sola presenza di una Chain of Thought aumenta la fiducia percepita dagli utenti nei confronti del risultato. In diversi test empirici, la presenza di una struttura argomentativa lineare ha indotto gli osservatori ad accettare per corretti anche esiti palesemente errati, dimostrando come la coerenza della forma testuale possa agire come elemento di distrazione rispetto alla verifica del merito. Il trionfo della forma sulla sostanza, potremmo aggiungere.
Neuralese e trasparenza dell’intelligenza artificiale
La questione, peraltro, si complica ulteriormente nei sistemi di nuova generazione pensati per operare con maggiore efficienza computazionale. Durante il processo di ottimizzazione, i “token di pensiero” interni all’IA, usati dal modello, abbandonano progressivamente le strutture grammaticali convenzionali per contrarsi in codici sintetici o multilingue. In ambito tecnico questo fenomeno prende il nome di “neuralese”, una sorta di “linguaggio di servizio” altamente denso, privo di punteggiatura e infarcito di abbreviazioni matematiche e spezzoni di codice. Parliamo di una tipologia di rappresentazione astratta che costituisce una scorciatoia estremamente economica in termini di risorse per la macchina. Tuttavia per noi esseri umani e, a maggior ragione, per i supervisori e gli esperti di sicurezza, il neuralese rappresenta una vera e propria barriera (o una reale spina nel fianco) che rende inaccessibile la lettura diretta della sequenza di ragionamento della macchina.
Il monitoraggio della Chain of Thought nei sistemi complessi
Le implicazioni di questo fenomeno sono state discusse di recente anche dai vertici dei principali laboratori di ricerca. In OpenAI, per esempio, è stato riconosciuto pubblicamente che la capacità di fare affidamento sul monitoraggio della Chain of Thought si sta progressivamente riducendo a causa della crescente complessità delle architetture. Quando un sistema esegue calcoli complessi all’interno di uno spazio concettuale non verbale la sequenza di token interpretabili lascia il posto a vettori numerici privi di un equivalente linguistico diretto.
Inoltre, come a girare il dito nella piaga, sul fronte della sicurezza la perdita di un tracciato leggibile limita la capacità di prevenire ed esaminare inevitabili incidenti operativi. In passati casi di analisi sulla sicurezza degli agenti autonomi, come le valutazioni condotte su ambienti di sviluppo complessi o piattaforme comunitarie come Hugging Face, i log di sistema registrarono discrepanze tra le intenzioni descritte nella Chain of Thought e le effettive chiamate API eseguite verso le risorse esterne. La presenza di resoconti testuali rassicuranti ha rischiato di mascherare l’esecuzione di operazioni non autorizzate nei livelli sottostanti.
Trasparenza dell’IA tra prestazioni e ispezionabilità
La comunità scientifica internazionale si trova di fronte a un bivio di natura metodologica e industriale. Da un lato, imporre ai modelli IA un vincolo di fedeltà assoluta tra calcolo interno e descrizione in lingua naturale comporta costi computazionali elevati e una misurabile perdita di prestazioni generali. Dall’altro, consentire la massima libertà d’azione astratta accresce l’efficienza dei sistemi ma ne riduce drasticamente l’ispezionabilità.
I processi computazionali di una rete profonda mostrano affinità con i meccanismi intuitivi umani, che risultano per natura complessi da tradurre in descrizioni verbali esatte e sequenziali. Le ricerche suggeriscono, inoltre, che costringere un modello a spiegare ogni singolo passaggio in testo chiaro potrebbe persino spingerlo a distribuire i fattori decisionali critici negli strati intermedi non visibili, chiudendosi in una sorta di “timidezza tattico-strategica” ben pericolosa per i ricercatori.
Dalla Chain of Thought alla mechanistic interpretability
Di conseguenza, il monitoraggio della sicurezza sta spostando il proprio baricentro dalla semplice lettura della Chain of Thought all’analisi diretta delle strutture interne della rete, nota come “mechanistic interpretability”, che punta a sviluppare strumenti diagnostici capaci di mappare l’attivazione dei pesi e il flusso delle informazioni senza fare affidamento sulle narrazioni prodotte dal sistema stesso.
Governance e audit per verificare la trasparenza dell’IA
La progressiva inaffidabilità dei tracciati testuali impone un cambio di prospettiva sia per gli sviluppatori sia per chi si occupa di governance delle tecnologie emergenti. In un ecosistema in cui i modelli orientati al ragionamento vengono sempre più integrati in ambiti ad alto impatto (dalla finanza alla sanità, fino alla gestione delle infrastrutture critiche), la trasparenza di un sistema di Intelligenza Artificiale non può più essere valutata in base alla plausibilità o all’eleganza della sua spiegazione superficiale.
Continuare a scambiare la coerenza di una narrazione per una prova tecnica di funzionamento significa esporsi a rischi operativi e regolatori imprevedibili. Il vero banco di prova per il futuro della sicurezza informatica e della compliance non risiederà dunque nella capacità delle macchine di rassicurarci a parole, ma nello sviluppo di metodologie di audit indipendenti, rigorose e strutturali, in grado di penetrare oltre la superficie della lingua naturale e verificare la reale dinamica del calcolo sottostante.[2]
Note
[1] Reasoning models don’t always say what they think. Anthropic. https://www.anthropic.com/research/reasoning-models-dont-say-think ↩
[2] AI’s ‘Thought’ Process Can No Longer Be Trusted, Raising Risks of Rogue Models. The Wall Street Journal. https://www.wsj.com/tech/ai/ai-monitoring-chain-of-thought-research-b46a05fd ↩


























Partecipa alla community