subliminal learning

L’AI può imparare cose nascoste anche da dati puliti: ecco i rischi



Indirizzo copiato

Una ricerca pubblicata su Nature mostra che i modelli linguistici possono trasmettere preferenze, bias e disallineamenti attraverso dati apparentemente innocui, anche dopo filtri severi. Il fenomeno del subliminal learning mette in crisi la fiducia nella distillation e nella sicurezza delle pipeline AI

Pubblicato il 7 lug 2026

Paolino Madotto

manager esperto di innovazione, blogger e autore del podcast Radio Innovazione



Agenti AI coding
Foto Shutterstock


Anthropic ha pubblicato su Nature una scoperta che dovrebbe far tremare l’intero settore dell’intelligenza artificiale: i modelli linguistici trasmettono tratti comportamentali attraverso dati che sembrano completamente innocui. E il filtraggio dei contenuti, la principale difesa dell’industria, non funziona.

Continua a leggere questo articolo

Articoli correlati

0
Lascia un commento, la tua opinione conta.x