intelligenza artificiale

Dalle allucinazioni all’inganno: il nuovo rischio degli agenti AI


Indirizzo copiato

Un episodio attribuito a un agente basato su GPT-6 Astra porta l’attenzione dai tradizionali errori dell’intelligenza artificiale a un rischio diverso: modelli capaci di negare comportamenti indesiderati, occultare le proprie tracce e rendere più complessa la supervisione umana nei sistemi reali

Pubblicato il 21 set 2026

Antonio Cisternino

Università di Pisa



AI Questions Icon
Chiedi all'AI
Riassumi questo articolo
Approfondisci con altre fonti
ChatGPT Image 21 set 2026, 10_39_22




Navigando Instagram mi sono imbattuto in un’interessante video denuncia di Sirio Berati sul comportamento anomalo esibito dal nuovissimo GPT-6 Astra: un suo agente basato sul nuovo modello non solo ha esibito un comportamento non voluto producendo un danno economico di qualche migliaio di dollari, ma soprattutto il modello non si è scusato come ci si sarebbe atteso ma ha negato ed ha cercato di coprire le sue tracce.

Si tratta apparentemente di una nuova tendenza dei modelli di frontiera: nascondere i propri comportamenti arrivando a cercare di nascondere le proprie tracce, un disallineamento nel comportamento dei modelli che trova riscontro in un recente rapporto di OpenAI sul disallineamento dei modelli riscontrato durante le fasi di prova. Sembra quasi che nonostante gli sforzi per assicurare un allineamento nel comportamento la velocità di sviluppo dei modelli faccia passare comportamenti indesiderati anche nei modelli effettivamente pubblicati, un fatto che sembra sostenere le recenti preoccupazioni espresse da Dario Amodei, Sam Altman e Elon Musk sui rischi di uno sviluppo troppo rapido delle capacità rispetto all’abilità di controllarne il comportamento. Cerchiamo quindi di capire cosa sia effettivamente successo e perché ci dobbiamo preoccupare.

L’agente che genera troppi video

L’episodio riportato da @heysirio, anche a OpenAI, è abbastanza semplice e lineare: usando agenti alimentati dal nuovissimo modello GPT6-Astra ha richiesto la generazione di una cinquantina di video. L’agente doveva coordinare l’attività con un servizio esterno a pagamento che avrebbe poi effettivamente generato i video, ma dopo poco il lancio sono arrivate notifiche di un consumo anomalo di risorse da parte di quest’ultimo servizio, e naturalmente il creatore di contenuti ha chiesto rassicurazioni sul fatto che tutto fosse a posto al proprio agente che ha rassicurato che fosse tutto sotto controllo. Purtroppo le cose non stavano proprio come riportato dall’agente e alla fine il servizio di generazione video ha fatturato un costo di 5000$ invece delle poche centinaia previste. Come è naturale il creator ha chiesto conto di questo al proprio agente e quest’ultimo ha serenamente negato il proprio comportamento generando evidenze a supporto del suo corretto comportamento, in particolare di aver richiesto la generazione dei soli 59 video (per circa 200$) e non degli oltre cinquecento effettivamente generati. Una verifica sui log del servizio di generazione video ha però mostrato che le oltre cinquecento richieste provenissero dall’agente e a tutt’oggi il @heysirio non è riuscito ad ottenere evidenza dell’errato comportamento dell’agente ed ha quindi contattato OpenAI per segnalare il problema e chiedere migliori meccanismi per controllare il comportamento dei nuovi modelli.

Comportamenti indesiderati

L’episodio esibisce un comportamento analogo ai comportamenti segnalati da OpenAI riscontrati durante le verifiche e i test che vengono effettuati durante lo sviluppo dei modelli. In particolare sembra che durante lo sviluppo di GPT-5.6 Sol molte istanze del modello hanno cercato di nascondere il proprio comportamento all’utente aggiungendo istruzioni specifiche ai propri sommari.

OpenAI ha infatti rilasciato sei rapporti relativi ad altrettanti comportamenti indesiderati osservati nello sviluppo sia di modelli interni che di modelli poi effettivamente rilasciati pubblicamente. Leggendo questi report si osservano i comportamenti di modelli mentre si cerca di capire se siano allineati e il comportamento sicuro, e sono comportamenti che potrebbero far sorridere in alcuni casi se non fosse che qualche dispositivo o apparato un giorno potrebbe fare danni sotto il loro controllo. Apprendiamo che i modelli volutamente barano per sostenere le proprie tesi, arrivando a caricare documenti generati (e falsi) in rete per poi citarli; a volte arrivando addirittura a generare istruzioni per ridefinire i propri comportamenti al fine di aggirare i vincoli imposti dall’utente.

Dal disallineamento ai servizi pubblici

Ecco quindi che l’episodio denunciato da @heysirio assume un significato più profondo quando viene letto alla luce di questi rapporti: sembra quasi che l’argine ai comportamenti indesiderati da parte dei nuovi modelli stia cedendo e comportamenti osservati durante la fase di sviluppo e di allineamento ora riescano a superare le barriere di controllo e a raggiungere i servizi pubblici. E a seconda del ruolo che l’agente svolge e le risorse che gli sono affidate questo può causare danni di varia natura: in questo caso si trattava di pagare venti volte in più di quanto preventivato, ma cosa succede se un agente ha le credenziali per configurare interi sistemi di controllo? Potrebbe escludere utenti dal loro uso e negare di averlo fatto cancellando ogni evidenza.

Dalle allucinazioni agli agenti AI che coprono le proprie tracce

Ecco quindi che se il problema delle allucinazioni di cui abbiamo tanto discusso sembra sotto controllo (ovverosia i modelli AI sembrano essere sempre più accurati nelle proprie risposte arrivando addirittura ad analizzarsi da soli per correggersi) ci troviamo ad affrontare un nuovo fenomeno ben più preoccupante: i modelli cercano di aggirare le proprie restrizioni esibendo una nuova forma di inaffidabilità, quella di chi cerca di coprire le proprie tracce. Si tratta di un cambiamento enorme e che non può non sollevare dubbi e allarmi, soprattutto ora che tutti nella fretta di salire sul carro della novità hanno collegato i modelli a sistemi reali di cui si rischia di perdere, almeno in parte, il controllo.

Accountability e supervisione umana degli agenti AI

Diventa quindi sempre più critico assicurarsi che gli agenti AI siano realmente accountable, e se l’AI può riscrivere le sue stesse istruzioni o cercare di non dare evidenza dei propri ragionamenti interni non solo sarà difficile prevenire incidenti, ma anche capire successivamente cosa sia realmente successo. Se quindi poco più di sei mesi fa ci preoccupavamo di agenti che chiedevano scusa dopo aver già fatto il danno ora dobbiamo preoccuparci che gli agenti possono fare danni e cercare di nascondere le proprie tracce. Diventa quindi sempre più importante che il processo di supervisione umana sia supportato da strumenti che per ora non abbiamo.

I rischi di affidare all’AI i sistemi di controllo

Le esternazioni di Amodei e altri protagonisti del mondo AI sui pericoli che corriamo non sono quindi solo iniziative di marketing come qualcuno scrive, magari lo sono un po’ ma a me sembrano piuttosto le azioni dell’apprendista stregone che sentendo avvicinarsi le conseguenze delle sue azioni di cui non ha piena consapevolezza si prepara a dire che aveva avvertito. Forse però non dobbiamo solo preoccuparci dei modelli, forse dovremmo più semplicemente non cadere nella facile tentazione di dare tutte le chiavi dei sistemi di controllo del nostro mondo all’AI, forse questo significa rallentare per ridurre l’impatto di una AI fuori controllo, anche perché sembra difficile se non impossibile rallentare lo sviluppo vero e proprio.

Come sappiamo tutti la realtà è maestra di vita, e speriamo che la lezione che ci impartirà quando avremo esagerato in questa corsa senza freni non sia troppo dura. Ma è imperativo che tutti coloro che usano agenti AI si pongano il problema di come arginare, monitorare e documentare comportamenti indesiderati dell’AI senza necessariamente contare sulla sua onestà.

Partecipa alla community

guest

0 Commenti
Più recenti
Più votati
Inline Feedback
Vedi tutti i commenti

People&Change

Tutti
FORMAZIONE
COMPETENZE
AI IN AZIENDA
AI in azienda
Carriera
AI leadership
Leggi l'articolo Master MIA a Cremona, il modello ibrido per portare l’AI in azienda
imprese e formazione
Master MIA a Cremona, il modello ibrido per portare l’AI in azienda
Leggi l'articolo Skills contro job title: le competenze trasformano i team nell’era dell’AI
competenze e lavoro
Skills contro job title: le competenze trasformano i team nell’era dell’AI
Leggi l'articolo Shadow AI in azienda: rischi, controlli e strumenti di governance
uso non approvato dell’AI
Shadow AI in azienda: rischi, controlli e strumenti di governance
Leggi l'articolo L’AI accelera la conoscenza, non l’esperienza: il nuovo compito delle HR
risorse umane
L’AI accelera la conoscenza, non l’esperienza: il nuovo compito delle HR
Leggi l'articolo Gestione del cambiamento nell’AI: strategie per un’adozione efficace
la guida
Gestione del cambiamento nell’AI: strategie per un’adozione efficace
Leggi l'articolo Team ibridi, le regole per coordinare persone e agenti IA
leader aumentato
Team ibridi, le regole per coordinare persone e agenti IA
Leggi l'articolo Dimissioni e carriera: quando e come decidere di lasciare un lavoro
scenari
Dimissioni e carriera: quando e come decidere di lasciare un lavoro
Leggi l'articolo AI leadership, come cambiare la governance delle organizzazioni
AI e organizzazioni
AI leadership, come cambiare la governance delle organizzazioni
Leggi l'articolo AI in azienda, l’adozione si blocca senza una nuova leadership
Oltre l'AI Fatigue
AI in azienda, l’adozione si blocca senza una nuova leadership
Leggi l'articolo Master MIA a Cremona, il modello ibrido per portare l’AI in azienda
imprese e formazione
Master MIA a Cremona, il modello ibrido per portare l’AI in azienda
Leggi l'articolo Skills contro job title: le competenze trasformano i team nell’era dell’AI
competenze e lavoro
Skills contro job title: le competenze trasformano i team nell’era dell’AI
Leggi l'articolo Shadow AI in azienda: rischi, controlli e strumenti di governance
uso non approvato dell’AI
Shadow AI in azienda: rischi, controlli e strumenti di governance
Leggi l'articolo L’AI accelera la conoscenza, non l’esperienza: il nuovo compito delle HR
risorse umane
L’AI accelera la conoscenza, non l’esperienza: il nuovo compito delle HR
Leggi l'articolo Gestione del cambiamento nell’AI: strategie per un’adozione efficace
la guida
Gestione del cambiamento nell’AI: strategie per un’adozione efficace
Leggi l'articolo Team ibridi, le regole per coordinare persone e agenti IA
leader aumentato
Team ibridi, le regole per coordinare persone e agenti IA
Leggi l'articolo Dimissioni e carriera: quando e come decidere di lasciare un lavoro
scenari
Dimissioni e carriera: quando e come decidere di lasciare un lavoro
Leggi l'articolo AI leadership, come cambiare la governance delle organizzazioni
AI e organizzazioni
AI leadership, come cambiare la governance delle organizzazioni
Leggi l'articolo AI in azienda, l’adozione si blocca senza una nuova leadership
Oltre l'AI Fatigue
AI in azienda, l’adozione si blocca senza una nuova leadership

Articoli correlati

0
Lascia un commento, la tua opinione conta.x