IA

Gemini 3.8 Live sostituisce il volto inespressivo dell’IA con un avatar

Adrian Kessler
Aggiungici su Google

Il sistema si chiama Gemini 3.8 Live con Live Avatar. Abbina il modello speech-to-speech di Google a un livello video in tempo reale che genera movimenti delle labbra ed espressioni facciali, gestendo nel frattempo le chiamate agli strumenti in background senza interrompere la conversazione. Il rilevamento della lingua è automatico: durante la chiamata l’avatar passa da una lingua parlata all’altra senza trasferimenti, ricaricamenti del sistema o pause percepibili.

A distinguere questa soluzione dalle tecniche basate sulla sovrapposizione di un video è il fatto che la generazione audio e quella video avvengono nello stesso flusso di inferenza in tempo reale, anziché in fasi successive. Questa integrazione mantiene la latenza abbastanza bassa da consentire un ritmo di conversazione naturale. Google incorpora in modo impercettibile il watermark SynthID sia nell’audio sia nel video: ogni secondo contiene un tag leggibile dalle macchine che lo identifica come contenuto generato dall’IA, anche se il flusso viene registrato e riprodotto in seguito. Il watermark resiste alla ricodifica, permettendo così di verificare la provenienza anche delle clip esportate.

Equal AI, che gestisce implementazioni aziendali in tutta l’India, offre l’indicazione più chiara di ciò che questa tecnologia consente su scala operativa: nove lingue indiane attive contemporaneamente, oltre un milione di chiamate in diretta al giorno e un totale di 97 lingue supportate. Con agenti umani, garantire una disponibilità e una copertura dei turni equivalenti sarebbe economicamente impraticabile a questi livelli di volume. Alla base dell’implementazione non c’è un progetto dimostrativo: l’obiettivo è gestire grandi volumi operativi.

Quello che il lancio non chiarisce è il prezzo. Google non ha pubblicato i costi e rimanda le richieste al proprio team commerciale dedicato alle aziende. La creazione di avatar personalizzati — per organizzazioni che vogliono ricavare un volto dalle proprie immagini di riferimento — richiede l’inserimento nella allowlist aziendale attraverso una procedura di verifica separata, anziché poter essere attivata in autonomia. Le funzionalità di Extended Thinking per il modello Live sono ancora in anteprima privata e limitano la profondità di ragionamento rispetto alle altre offerte Gemini di Google. Non sono stati resi noti neppure i limiti alle sessioni simultanee. Il profilo ristretto del lancio è in linea con la strategia adottata da Google per le distribuzioni aziendali graduali, in cui prezzi e capacità vengono negoziati invece di essere pubblicati.

Gemini 3.8 Live con Live Avatar è già disponibile nella console Gemini Enterprise e tramite la Live API, con endpoint negli Stati Uniti e nell’Unione Europea. Per Extended Thinking sul modello Live non è stata comunicata alcuna tempistica per un accesso più ampio oltre all’attuale gruppo di utenti in anteprima privata.

Le aziende che lo adotteranno dovranno rispondere a una domanda che la tecnologia lascia aperta: eliminare il segnale visivo che contraddistingue un’interazione automatizzata migliora l’esperienza degli utenti, oppure cancella l’ultimo indizio onesto del fatto che stanno parlando con un sistema automatizzato?

Tag: , , , , ,

Aggiungici su Google

Discussione

Ci sono 0 commenti.