OpenAI ha annunciato una sempre più pervasiva integrazione del nuovo modello live voice nelle proprie interfacce, in particolare adesso è ora possibile interagire vocalmente anche con i plugin e le relative applicazioni ed anche l’agente Work ha introdotto l’interfaccia per l’AI conversazionale.
Ma quali sono le conseguenze di questa sempre più pervasiva integrazione di un’interazione vocale con l’AI? Come cambierà la user experience nella nostra interazione con le macchine? Staremo meno incollati agli schermi? Cerchiamo di capire perché gli sviluppi nelle conversazioni sono destinati a rivoluzionare il modo con cui interagiamo con le macchine.

Indice degli argomenti
Evoluzione di un modo di interagire
Ricordo ancora la mia prima intervista ad una AI, poco più di due anni fa avevo avuto l’opportunità di testare in anteprima l’advanced voice mode di ChatGPT 4o ed ero rimasto impressionato dalla fluidità dell’interazione vocale con l’AI, in particolare dalla naturalezza con cui si poteva interrompere l’interlocutore e dalla notevole riduzione di pause che normalmente accompagnavano una conversazione in cui uno registra un audio, lo trascrive per passarlo al modello che inverte il processo per generare una risposta.
L’advanced voice mode è stato per me un utile compagno negli ultimi due anni, soprattutto quando sono in giro e l’interazione vocale con l’AI è più pratica (ed è socialmente accettabile se si indossano cuffie e chi sta vicino pensa che si stia al telefono). Ho addirittura associato al bottone programmabile del mio iPhone l’avvio della conversazione in modo da ottenere informazioni e fare brainstorming mentre sono in giro ottenendo anche la trascrizione delle interazioni per usi successivi.
Va detto però che la modalità vocale di OpenAI, sebbene decisamente utile in molte situazioni, non era sempre all’altezza delle richieste e comunque era prettamente conversazionale: non avevo accesso alla deep research e alle altre funzionalità che i modelli hanno offerto via via all’interazione testuale. Per questo il recente annuncio dell’8 luglio di GPT-Live mi ha incuriosito: l’interazione vocale è stata di fatto separata dalla piena interazione con l’AI trasformandosi in un’attività multi-agente in cui il modello GPT-Live non è chiuso in sé stesso bensì ha la possibilità di delegare ad agenti che lavorano in background compiti di ragionamento, questo offre la possibilità di beneficiare di ragionamento che usa modelli più capaci del modello che gestisce la conversazione offrendo quindi risultati decisamente migliori.

È in questo quadro che va letto il recente annuncio che l’interazione vocale con GPT-Live viene estesa all’agente ChatGPT Work e soprattutto ai nuovi plugin, il nuovo meccanismo che entro dicembre sostituirà i vecchi GPT e che consente a parti terze di offrire conoscenza e comportamenti specializzati per servizi specifici. Grazie a quest’ultima interazione potremo di fatto esprimere vocalmente necessità e comandi i cui effetti andranno ben oltre la mera conversazione, e anche mediante GPT Work potremo controllare il nostro computer, anche a distanza mediante interazioni dalla app all’agente in esecuzione sul computer di casa.
L’interazione vocale pervasiva
La possibilità di interagire con sistemi al di fuori del perimetro di OpenAI è di per sé una notizia visto che sono un utente frustrato di Alexa+ che ha intervalli di risposta decisamente insoddisfacenti rispetto a GPT-Live anche se l’ho lasciata attivata perché mi consente di esprimere richieste che nella vecchia Alexa erano semplicemente impossibili. Ma oltre al crescere di Alexa+ pochi giorni fa anche la mia auto mi ha chiesto di passare a Gemini per le interazioni vocali, e anche Microsoft e Apple sembrano lavorare nella direzione di avere agenti conversazionali veri e propri integrati nei sistemi.
Sembra quindi verosimile che l’interazione vocale con le macchine divenga finalmente una realtà, superando interazioni frustranti che hanno caratterizzato le esperienze precedenti già tentate nel mondo digitale.
Disporre di macchine capaci di ascoltare avendo memoria e contesto sicuramente avvicina l’interazione al nostro modo di interagire e sicuramente ci può liberare, almeno in parte, della costante presenza di schermi mouse e tastiere che ci hanno accompagnato dall’arrivo del personal computer prima e dello smartphone successivamente. È naturale quindi chiedersi come la cosiddetta user experience (UX) evolverà e se un’interazione vocale rapida e affidabile possa rappresentare la nuova rivoluzione in questo cambio dall’arrivo dello schermo touch.
Le criticità di questo nuovo modo di interazione
Ma quali sono le criticità di questo nuovo modo di interazione?
In primis c’è la questione della disponibilità di rete: GPT-Live per ora sembra l’unico modello capace di fornire una conversazione veramente convincente e simile a quella che si ha tra due persone, ma per poter funzionare richiede la rete. Esistono modelli capaci di elaborare voce anche on-premises, come ad esempio Gemma 4 E4B, ma sono ben lontani dall’offrire un’interazione naturale e comunque ad un costo computazionale per ora poco sostenibile per essere utilizzato su dispositivi personali.
C’è poi il problema della sicurezza: l’AI per ora non è realmente capace di distinguere le voci in modo affidabile, e c’è il rischio che l’interazione vocale sia utilizzata da utenti non autorizzati. Ad esempio, quando Apple lanciò molti anni fa il supporto per la domotica con Siri un utente mostrò un bellissimo video in cui urlando da fuori di una casa “Hey Siri, open the door!” riusciva ad accedere senza avere le chiavi!
Infine, a volte anche noi umani abbiamo necessità di indicare qualcosa mentre parliamo, e questo aspetto non è ancora soddisfacente e lo dimostra proprio OpenAI che con la nuova applicazione desktop di ChatGPT ha reso decisamente più articolata l’interfaccia rispetto alla casella di testo che attendeva un semplice prompt. Certo, sull’applicazione mobile durante una conversazione è possibile avviare un video per mostrare qualcosa all’AI, ma sembra per ora essere un’interazione che non è pronta per funzionare su larga scala.
Conclusioni
L’evoluzione dell’interazione vocale grazie agli LLM è stata significativa ed è assolutamente realistico che nel prossimo futuro una parte sempre maggiore delle nostre interazioni con le macchine passi mediante una conversazione vocale. L’abilitazione ai plugin di GPT-Live apre la via ad un assistente conversazionale capace di interagire con sistemi esterni e non mi stupirebbe se OpenAI promuovesse dispositivi simili ad Alexa nel futuro, e sul piano dell’interazione i competitor sembrano essere indietro rispetto al colosso di GPT anche se ne stanno seguendo le orme.
Nel prossimo futuro sembra che queste interazioni cresceranno in tutte quelle situazioni, come l’interazione con parti della casa o la guida di un auto, in cui l’interazione vocale porta effettivi benefici, e nel resto delle applicazioni vedremo sempre più spesso l’opzione di avviare una conversazione vocale affiancata ai sistemi di input più tradizionali. Personalmente non posso non osservare come sempre più spesso delego le interazioni alla conversazione, e sembra un trend che progredisce nel tempo, magari questo ridurrà un po’ lo il tempo speso di fronte ad uno schermo, e questo penso che sarebbe una buona notizia.





















Partecipa alla community