IA

ElevenLabs v4 clona la tua voce con 10 secondi di audio e la fa parlare in 90 lingue

Susan Hill
Aggiungici su Google

ElevenLabs ha lanciato Eleven v4, un modello di sintesi vocale che legge ad alta voce i testi scritti aggiungendo una risata, un sospiro o un accento francese arrabbiato, se richiesto da chi scrive. Per clonare una voce all’istante basta una registrazione più breve di un messaggio in segreteria; la voce clonata può poi parlare decine di lingue mantenendo il proprio timbro. Il servizio è disponibile per chiunque abbia un account gratuito ElevenLabs.

Per chi crea contenuti audio, significa risparmiare intere giornate di lavoro. Un podcaster può doppiare un episodio in giapponese con la propria voce, uno sviluppatore di videogiochi indipendente può assegnare a ogni personaggio secondario un modo di parlare distinto senza prenotare uno studio, e un narratore di audiolibri può inserire nel copione una pausa o una risatina. Ma c’è anche il rovescio della medaglia, altrettanto concreto: un messaggio vocale, una clip di una videochiamata o pochi secondi di un post pubblico sono ormai materiale sufficiente per creare una copia convincente della voce di qualcuno.

La novità principale è il livello di controllo, mentre per creare il clone bastano appena 10 secondi di audio. I modelli precedenti di ElevenLabs leggevano i testi in modo pulito, ma dovevano indovinare il tono emotivo. La versione 4 accetta indicazioni di recitazione inserite nel testo tra parentesi quadre, come [ride] o [detto con rabbia e accento francese], e persino suggerimenti per i suoni di sottofondo, come [pioggia leggera] o [telefono che vibra]. L’azienda afferma che il modello ricava tono e ritmo anche dal contesto, così una battuta in una scena carica di tensione suona tesa anche senza indicazioni specifiche. Nelle scene con più interlocutori, ogni voce rimane coerente anche nei passaggi più lunghi: un punto debole della narrazione sintetica, in cui le voci tendevano a cambiare nel corso di un capitolo.

Le lingue supportate passano dalle 70 della versione precedente a oltre 90. Secondo TechCrunch, ElevenLabs ha indicato giapponese, portoghese brasiliano, mandarino e cantonese tra le lingue in cui la qualità è migliorata maggiormente. Quando cambia lingua, la voce clonata conserva la propria identità: il clone di una persona che parla spagnolo, per esempio, legge un testo in tedesco continuando a suonare come quella persona, ma con un accento tedesco nativo. Un secondo modello, v4 Turbo, è progettato per gli assistenti vocali e gli operatori dei call center. Comincia a parlare in circa 150 millisecondi, più o meno il tempo che intercorre tra due turni di parola in una conversazione, e può iniziare a rispondere prima ancora che il chatbot che lo alimenta abbia finito di formulare la risposta.

ElevenLabs non è sola in questo mercato. Google, OpenAI, Cartesia, Deepgram e Fish Audio vendono voci sintetiche agli stessi sviluppatori. A poche ore dal lancio, la società indipendente di benchmarking Artificial Analysis ha collocato v4 al primo posto nella propria classifica delle voci, in cui gli ascoltatori valutano campioni anonimi affiancati. ElevenLabs afferma inoltre che, nei confronti alla cieca con i concorrenti, circa tre ascoltatori su quattro hanno preferito v4: un dato che proviene dai test condotti dall’azienda stessa.

Le riserve cominciano proprio da quei 10 secondi. ElevenLabs dichiara che per clonare una voce serve il consenso della persona a cui appartiene, che utilizza un classificatore pubblico in grado di segnalare l’audio creato con i suoi strumenti e che blocca direttamente i cloni di alcune figure politiche. Questi controlli frenano gli abusi più improvvisati, ma dipendono dalla sincerità di chi carica il campione; a un truffatore basta una breve registrazione della voce di un familiare per inscenare una falsa chiamata d’emergenza. Anche il piano gratuito è limitato: circa 10 minuti di audio generato al mese, secondo il riepilogo dei piani pubblicato da Unite.AI, mentre gli abbonamenti a pagamento partono da 6 dollari al mese.

Eleven v4 e v4 Turbo sono stati resi disponibili il 28 settembre nell’app per creator di ElevenLabs, sulla sua piattaforma per agenti e tramite la sua API per sviluppatori. L’azienda, con sede a Londra, ha raccolto a febbraio 500 milioni di dollari da Sequoia, raggiungendo una valutazione di 11 miliardi di dollari. TechCrunch riferisce che i suoi ricavi annualizzati hanno superato i 600 milioni di dollari. L’amministratore delegato Mati Staniszewski ha dichiarato a TechCrunch che l’azienda punta a quotarsi in Borsa nei prossimi anni, senza indicare una data.

Per chi crea contenuti, una voce che ride a comando in 90 lingue equivale a uno studio di registrazione in una scheda del browser. Per tutti gli altri, è un motivo in più per riagganciare e richiamare quando una voce familiare al telefono chiede denaro.

Tag: , , , , ,

Aggiungici su Google

Discussione

Ci sono 0 commenti.