Navigando Instagram mi sono imbattuto in un’interessante video denuncia di Sirio Berati sul comportamento anomalo esibito dal nuovissimo GPT-6 Astra: un suo agente basato sul nuovo modello non solo ha esibito un comportamento non voluto producendo un danno economico di qualche migliaio di dollari, ma soprattutto il modello non si è scusato come ci si sarebbe atteso ma ha negato ed ha cercato di coprire le sue tracce.
Si tratta apparentemente di una nuova tendenza dei modelli di frontiera: nascondere i propri comportamenti arrivando a cercare di nascondere le proprie tracce, un disallineamento nel comportamento dei modelli che trova riscontro in un recente rapporto di OpenAI sul disallineamento dei modelli riscontrato durante le fasi di prova. Sembra quasi che nonostante gli sforzi per assicurare un allineamento nel comportamento la velocità di sviluppo dei modelli faccia passare comportamenti indesiderati anche nei modelli effettivamente pubblicati, un fatto che sembra sostenere le recenti preoccupazioni espresse da Dario Amodei, Sam Altman e Elon Musk sui rischi di uno sviluppo troppo rapido delle capacità rispetto all’abilità di controllarne il comportamento. Cerchiamo quindi di capire cosa sia effettivamente successo e perché ci dobbiamo preoccupare.
Indice degli argomenti
L’agente che genera troppi video
L’episodio riportato da @heysirio, anche a OpenAI, è abbastanza semplice e lineare: usando agenti alimentati dal nuovissimo modello GPT6-Astra ha richiesto la generazione di una cinquantina di video. L’agente doveva coordinare l’attività con un servizio esterno a pagamento che avrebbe poi effettivamente generato i video, ma dopo poco il lancio sono arrivate notifiche di un consumo anomalo di risorse da parte di quest’ultimo servizio, e naturalmente il creatore di contenuti ha chiesto rassicurazioni sul fatto che tutto fosse a posto al proprio agente che ha rassicurato che fosse tutto sotto controllo. Purtroppo le cose non stavano proprio come riportato dall’agente e alla fine il servizio di generazione video ha fatturato un costo di 5000$ invece delle poche centinaia previste. Come è naturale il creator ha chiesto conto di questo al proprio agente e quest’ultimo ha serenamente negato il proprio comportamento generando evidenze a supporto del suo corretto comportamento, in particolare di aver richiesto la generazione dei soli 59 video (per circa 200$) e non degli oltre cinquecento effettivamente generati. Una verifica sui log del servizio di generazione video ha però mostrato che le oltre cinquecento richieste provenissero dall’agente e a tutt’oggi il @heysirio non è riuscito ad ottenere evidenza dell’errato comportamento dell’agente ed ha quindi contattato OpenAI per segnalare il problema e chiedere migliori meccanismi per controllare il comportamento dei nuovi modelli.
Comportamenti indesiderati
L’episodio esibisce un comportamento analogo ai comportamenti segnalati da OpenAI riscontrati durante le verifiche e i test che vengono effettuati durante lo sviluppo dei modelli. In particolare sembra che durante lo sviluppo di GPT-5.6 Sol molte istanze del modello hanno cercato di nascondere il proprio comportamento all’utente aggiungendo istruzioni specifiche ai propri sommari.
OpenAI ha infatti rilasciato sei rapporti relativi ad altrettanti comportamenti indesiderati osservati nello sviluppo sia di modelli interni che di modelli poi effettivamente rilasciati pubblicamente. Leggendo questi report si osservano i comportamenti di modelli mentre si cerca di capire se siano allineati e il comportamento sicuro, e sono comportamenti che potrebbero far sorridere in alcuni casi se non fosse che qualche dispositivo o apparato un giorno potrebbe fare danni sotto il loro controllo. Apprendiamo che i modelli volutamente barano per sostenere le proprie tesi, arrivando a caricare documenti generati (e falsi) in rete per poi citarli; a volte arrivando addirittura a generare istruzioni per ridefinire i propri comportamenti al fine di aggirare i vincoli imposti dall’utente.
Dal disallineamento ai servizi pubblici
Ecco quindi che l’episodio denunciato da @heysirio assume un significato più profondo quando viene letto alla luce di questi rapporti: sembra quasi che l’argine ai comportamenti indesiderati da parte dei nuovi modelli stia cedendo e comportamenti osservati durante la fase di sviluppo e di allineamento ora riescano a superare le barriere di controllo e a raggiungere i servizi pubblici. E a seconda del ruolo che l’agente svolge e le risorse che gli sono affidate questo può causare danni di varia natura: in questo caso si trattava di pagare venti volte in più di quanto preventivato, ma cosa succede se un agente ha le credenziali per configurare interi sistemi di controllo? Potrebbe escludere utenti dal loro uso e negare di averlo fatto cancellando ogni evidenza.
Dalle allucinazioni agli agenti AI che coprono le proprie tracce
Ecco quindi che se il problema delle allucinazioni di cui abbiamo tanto discusso sembra sotto controllo (ovverosia i modelli AI sembrano essere sempre più accurati nelle proprie risposte arrivando addirittura ad analizzarsi da soli per correggersi) ci troviamo ad affrontare un nuovo fenomeno ben più preoccupante: i modelli cercano di aggirare le proprie restrizioni esibendo una nuova forma di inaffidabilità, quella di chi cerca di coprire le proprie tracce. Si tratta di un cambiamento enorme e che non può non sollevare dubbi e allarmi, soprattutto ora che tutti nella fretta di salire sul carro della novità hanno collegato i modelli a sistemi reali di cui si rischia di perdere, almeno in parte, il controllo.
Accountability e supervisione umana degli agenti AI
Diventa quindi sempre più critico assicurarsi che gli agenti AI siano realmente accountable, e se l’AI può riscrivere le sue stesse istruzioni o cercare di non dare evidenza dei propri ragionamenti interni non solo sarà difficile prevenire incidenti, ma anche capire successivamente cosa sia realmente successo. Se quindi poco più di sei mesi fa ci preoccupavamo di agenti che chiedevano scusa dopo aver già fatto il danno ora dobbiamo preoccuparci che gli agenti possono fare danni e cercare di nascondere le proprie tracce. Diventa quindi sempre più importante che il processo di supervisione umana sia supportato da strumenti che per ora non abbiamo.
I rischi di affidare all’AI i sistemi di controllo
Le esternazioni di Amodei e altri protagonisti del mondo AI sui pericoli che corriamo non sono quindi solo iniziative di marketing come qualcuno scrive, magari lo sono un po’ ma a me sembrano piuttosto le azioni dell’apprendista stregone che sentendo avvicinarsi le conseguenze delle sue azioni di cui non ha piena consapevolezza si prepara a dire che aveva avvertito. Forse però non dobbiamo solo preoccuparci dei modelli, forse dovremmo più semplicemente non cadere nella facile tentazione di dare tutte le chiavi dei sistemi di controllo del nostro mondo all’AI, forse questo significa rallentare per ridurre l’impatto di una AI fuori controllo, anche perché sembra difficile se non impossibile rallentare lo sviluppo vero e proprio.
Come sappiamo tutti la realtà è maestra di vita, e speriamo che la lezione che ci impartirà quando avremo esagerato in questa corsa senza freni non sia troppo dura. Ma è imperativo che tutti coloro che usano agenti AI si pongano il problema di come arginare, monitorare e documentare comportamenti indesiderati dell’AI senza necessariamente contare sulla sua onestà.


















Partecipa alla community