La voce è la nuova frontiera dell’intelligenza artificiale

19 Agosto 2026 - 04:55
0
La voce è la nuova frontiera dell’intelligenza artificiale

La voce sta diventando sempre di più il comando con cui si affida lavoro all’intelligenza artificiale. Finché i sistemi si limitavano a rispondere a una domanda, digitare restava il metodo più preciso. Ora che gli agenti possono intervenire su un file e portare avanti un incarico per diversi minuti, parlare offre un vantaggio diverso: permette di spiegare rapidamente che cosa si vuole ottenere e di correggere il software mentre lavora.  A rendere praticabile questo passaggio è stato un cambiamento nell’architettura dei modelli vocali. I vecchi assistenti dividevano ogni scambio in tre operazioni successive. Prima trascrivevano la voce, poi affidavano il testo a un modello linguistico, infine convertivano la risposta in audio. Il procedimento funzionava per chiedere le previsioni del tempo o impostare una sveglia, ma introduceva un ritardo percepibile e, nel passaggio al testo, lasciava spesso fuori elementi della voce come l’intonazione e il ritmo. L’intonazione può tradire un’incertezza; una pausa può essere soltanto il tempo necessario a trovare una parola. I sistemi a cascata faticavano a distinguere questi segnali dalla fine dell’intervento e potevano interpretare ripensamenti e autocorrezioni come frammenti separati.

Secondo il Grand View Research gli agenti vocali valgono già 3,5 miliardi di dollari ed entro il 2033 potrebbero aumentare fino a 35,2 miliardi, con una crescita media annua del 39 per cento. GPT Live, presentato da OpenAI l’8 luglio, elabora la conversazione in tempo reale. Grazie a un’architettura full duplex, capace cioè di ricevere e trasmettere audio nello stesso momento, il sistema continua ad ascoltare anche mentre risponde,  come accade in una telefonata tra due persone. L’utente può interromperlo, cambiare istruzione o prendersi qualche secondo per pensare. La differenza sembra sottile, ma elimina uno dei difetti più riconoscibili degli assistenti tradizionali: quel momento in cui la macchina comincia a parlare mentre l’interlocutore sta ancora formulando la richiesta. 

Il coding è uno dei primi ambienti in cui questa modalità ha trovato un’utilità concreta. Quando scrive un prompt, l’utente tende a ridurre il problema alla richiesta immediata: correggi questa funzione, cerca questo errore. Stop. Parlando, è più facile raccontare come si è arrivati al problema e quali soluzioni sono già state escluse. Entrano nella conversazione dettagli che sembrano marginali, ma che aiutano l’agente a scegliere dove intervenire. Per un sistema chiamato a modificare un progetto, sapere perché una soluzione è preferibile può contare più dell’istruzione operativa presa da sola. Come riportato dal sito TechCrunch, durante una dimostrazione, un programmatore ha chiesto al sistema di individuare la causa di un errore, aprire una nuova sessione e preparare una modifica al codice. L’ordine iniziale ha messo in moto una procedura che, eseguita a mano, avrebbe richiesto diversi passaggi

La voce non si presta allo stesso modo a tutte le fasi del lavoro: un programmatore può spiegare a voce quale comportamento desidera, ma difficilmente revisionerà così una modifica di cento righe; un avvocato può dettare i criteri con cui analizzare un contratto, poi avrà bisogno di leggere le clausole. Lo schermo resta il luogo dove verificare il dato, soprattutto quando occorre confrontare versioni o tornare su un dettaglio preciso. La voce diventa strategica quando è il primo punto di contatto con l’utente. L’assistente interpreta la richiesta e decide quale applicazione usare. Se conserva il contesto, collega i comandi successivi al lavoro già avviato. Per le grandi piattaforme significa controllare l’accesso ai servizi digitali, come i sistemi operativi fanno con le app. 

Apple parte con un vantaggio evidente. Siri è già installata su centinaia di milioni di dispositivi e dispone, con il consenso dell’utente, di accessi che un’applicazione esterna deve chiedere uno alla volta. Siri AI può cercare informazioni nei messaggi e nelle email, oltre a interpretare ciò che appare sullo schermo. Se qualcuno domanda quale fosse il ristorante consigliato da un amico, il sistema deve capire a quale conversazione si riferisce, trovare il messaggio e distinguere una raccomandazione da una semplice menzione. È un lavoro di ricostruzione del contesto personale, molto più delicato di una ricerca sul web. 

I dati diffusi da Google in un interessante articolo del Financial Times, aiutano a capire perché le big tech insistano sulla voce. Le conversazioni vocali con i suoi sistemi durano in media cinque volte più di quelle testuali. L’uso della modalità dal vivo è raddoppiato nell’anno concluso ad aprile. OpenAI afferma che oltre 150 milioni di persone utilizzano ogni settimana la voce o la dettatura in ChatGPT. 

Una conversazione vocale impegna il sistema per tutta la sua durata, facendo salire i costi. Deve inoltre capire quando intervenire e restare pronto alle interruzioni. Anche un secondo di ritardo, quasi irrilevante in chat, al telefono spezza il dialogo. Ridurre la latenza richiede più capacità di calcolo oppure modelli vocali più leggeri. Boson AI ha scelto la prima strada insieme a un lavoro di ottimizzazione dell’intero sistema. La società sostiene che il suo modello speech to speech possa operare a circa un decimo del costo delle offerte concorrenti. Consente inoltre ai clienti di eseguirlo nei propri centri dati. Per una banca, questa possibilità serve a mantenere registrazioni e informazioni finanziarie dentro un’infrastruttura controllata direttamente, anziché inviarle a un fornitore esterno a ogni chiamata. Smallest.ai, che a luglio ha raccolto 13 milioni di dollari, ha scelto la strada opposta: separare la conversazione dal ragionamento più impegnativo. Un modello piccolo ascolta e risponde sui temi per i quali è stato addestrato. Quando incontra una richiesta fuori dal proprio ambito, consulta un modello più grande e fa attendere l’interlocutore per qualche istante. L’espediente riproduce ciò che accade quando un operatore umano deve verificare un’informazione. Soprattutto, evita di usare il modello più costoso durante ogni secondo della chiamata.

Questa divisione del lavoro sta definendo la struttura industriale del settore. Alcune società sviluppano i modelli che riconoscono o generano il parlato. Altre assemblano questi componenti in un agente capace di funzionare sulla rete telefonica. Il valore commerciale si sposta poi verso chi collega l’agente ai sistemi interni dell’impresa. Una voce convincente può rassicurare il cliente, ma la chiamata si risolve soltanto se il software riesce a trovare l’ordine corretto o a modificare davvero una prenotazione. È su questa fetta di mercato che lavora Fonio.ai, una società che dichiara di gestire più di due milioni di chiamate al mese per 7.500 imprese. A giugno ha raccolto 17 milioni di dollari con una valutazione di 140 milioni. I suoi agenti vengono impiegati per l’assistenza e per fissare appuntamenti. L’azienda sta estendendo il prodotto alla messaggistica e alla posta elettronica, perché una richiesta cominciata al telefono può proseguire altrove. L’agente deve conservare ciò che è già accaduto, altrimenti ogni canale diventa un nuovo punto di partenza. 

L’interesse delle imprese dipende in larga misura dalla possibilità di assorbire le chiamate ripetitive senza aumentare il personale. Nei call center il costo del lavoro pesa molto più dell’infrastruttura tecnologica. Una parte dell’attività segue procedure stabili e può essere distribuita su volumi enormi. Automatizzare anche una quota limitata delle conversazioni modifica quindi i conti dell’intero servizio. E poi il telefono è un’infrastruttura universale e non richiede al cliente di imparare un nuovo strumento. Le imprese dispongono inoltre di grandi archivi di chiamate, utili per individuare le richieste più frequenti e osservare come vengono risolte. Quei dati permettono di costruire un agente specializzato su procedure reali. Non bastano però a renderlo affidabile: una conversazione registrata mostra che cosa è stato detto, mentre spesso non rivela quali passaggi interni abbiano portato alla soluzione. 

Per completare una richiesta, l’agente deve accedere ai programmi che gestiscono clienti e pagamenti. Deve anche rispettare le autorizzazioni previste per un operatore umano. Se una persona chiede di cambiare l’indirizzo associato a un conto, riconoscere l’intenzione è la parte più facile. Poi però occorre verificare l’identità e stabilire se la modifica è consentita. Qui è più complicato perché un sistema può comprendere perfettamente la frase e compiere comunque l’azione sbagliata.

La riproducibilità della voce mette sotto pressione anche le norme esistenti. Il copyright protegge una registrazione, ma non sempre copre il timbro di una persona. Nell’Unione europea non esiste un diritto unico sul timbro vocale. Il copyright e i diritti connessi proteggono una registrazione specifica e l’interpretazione registrata, non la voce in sé. Un’imitazione generata senza copiare quell’audio può quindi restare fuori dal copyright, pur violando le norme nazionali sui diritti della personalità. Il GDPR si applica se i dati vocali riguardano una persona identificata o identificabile. Le regole più severe dell’articolo 9 scattano quando la voce viene elaborata come dato biometrico per riconoscere quella persona in modo univoco.

Dal 2 agosto 2026 si applica l’articolo 50 dell’AI Act. Un agente vocale che conversa direttamente con una persona deve informarla che sta interagendo con un sistema di IA, salvo che ciò sia già evidente. Il fornitore di un modello che genera audio sintetico deve inoltre rendere l’output riconoscibile in formato leggibile dalle macchine. Se il sistema viene usato per imitare la voce di una persona reale e produrre un deepfake, chi lo utilizza deve dichiararne la natura artificiale. Sono obblighi di trasparenza, non una richiesta generale di consenso. In una telefonata, l’avviso deve arrivare prima che l’interlocutore possa credere di parlare con un essere umano. Per le aziende, la difficoltà sarà renderlo chiaro senza riportare l’esperienza al tono impersonale dei vecchi centralini automatici.

Anche risolti questi problemi, l’uso quotidiano incontra dei limiti difficilmente aggirabili nel mondo del lavoro. Parlare a un computer in un ufficio condiviso disturba chi è vicino e può rendere udibili informazioni riservate. La voce funziona bene mentre si cammina o si guida, meno durante una riunione silenziosa. L’industria dell’hardware sta cercando di ridurre questo attrito con microfoni direzionali e dispositivi che richiedono un gesto intenzionale prima di registrare.

Sandbar ha scelto un anello in cui pronunciare brevi comandi. Plaud produce apparecchi dedicati alla registrazione delle conversazioni. Aina, finanziata con 5,5 milioni di dollari, sta lavorando su strumenti che permettono di controllare gli agenti e seguirne l’attività. Il loro compito è rendere evidente quando il microfono è acceso e separare la voce dell’utente dal rumore circostante. OpenAI invece sta preparando un tentativo più ambizioso. Il primo apparecchio sviluppato con il gruppo di Jony Ive dovrebbe essere un altoparlante portatile senza schermo, dotato di camera e sensori capaci di leggere l’ambiente. L’acquisizione di io per 6,5 miliardi di dollari ha dato al progetto una scala industriale. Il lancio è atteso nel 2027 e il prezzo potrebbe superare i 300 dollari. 

L'articolo La voce è la nuova frontiera dell’intelligenza artificiale proviene da Linkiesta.it.

Qual è la tua reazione?

Mi piace Mi piace 0
Antipatico Antipatico 0
Lo amo Lo amo 0
Comico Comico 0
Wow Wow 0
Triste Triste 0
Furioso Furioso 0
Redazione

Redazione Eventi e News

Commenti (0)

User