Soddisfare
ElevenLabs presenta i modelli vocali v4 con clonazione della voce più rapida e supporto linguistico più ampio
Nuova architettura e clonazione della voce più rapida
Espressività e comprensione del contesto migliorate
Supporto per oltre 90 lingue
Latenza ridotta per gli agenti vocali aziendali
Cresce la concorrenza nell'IA vocale
Finanziamenti, crescita dei ricavi ed espansione
Possibili piani per una IPO
Il modello vocale v4 di ElevenLabs offre un maggiore controllo dell’espressività e supporta 90 lingue
Tempo: Sep, 28, 2026

ElevenLabs presenta i modelli vocali v4 con clonazione della voce più rapida e supporto linguistico più ampio

Lunedì ElevenLabs ha lanciato due nuovi modelli vocali: ElevenLabs v4 e v4 Turbo. I modelli offrono un maggiore controllo sull'espressività vocale, una latenza ridotta per gli agenti vocali e il supporto per oltre 90 lingue.

Nuova architettura e clonazione della voce più rapida

Dopo aver rilasciato il modello v3 lo scorso anno e aver presentato in anteprima il suo successore durante un evento a Varsavia all'inizio di quest'anno, ElevenLabs ha introdotto una nuova architettura per la generazione v4. Il design aggiornato offre un controllo più preciso e una clonazione della voce più rapida, consentendo agli utenti di replicare una voce partendo da soli 10 secondi di audio.

Espressività e comprensione del contesto migliorate

Per le applicazioni creative, v4 preserva l'identità vocale in modo più coerente nei passaggi più lunghi. Inoltre, durante la lettura ad alta voce tiene conto del contesto testuale, consentendo variazioni espressive più appropriate.

ElevenLabs ha introdotto i tag di espressione inline con v3. In v4, questa funzionalità è stata ampliata per consentire agli utenti di combinare più tag, che il modello segue in sequenza.

Supporto per oltre 90 lingue

Il modello precedente supportava 70 lingue, mentre v4 estende la copertura a oltre 90. Secondo ElevenLabs, i maggiori miglioramenti qualitativi sono stati osservati in giapponese, portoghese brasiliano, cinese mandarino e cantonese.

Latenza ridotta per gli agenti vocali aziendali

ElevenLabs ha ampliato rapidamente la propria attività nel settore delle chiamate aziendali nell'ultimo anno, con le grandi imprese che ora rappresentano oltre il 55% del suo business. L'azienda afferma che v4 è particolarmente adatto agli agenti vocali, poiché la sua latenza ridotta consente conversazioni più fluide e naturali.

Il modello può iniziare a produrre audio non appena il modello linguistico di grandi dimensioni sottostante comincia a generare una risposta. Può inoltre reagire in modo diverso a situazioni di conflitto, escalation e messa in attesa, favorendo una risoluzione più efficace dei problemi.

Cresce la concorrenza nell'IA vocale

La concorrenza nel mercato dei modelli vocali si è intensificata, mentre startup come Cartesia, Deepgram, Fish Audio, Boson e WellSaid Labs sviluppano sistemi sempre più espressivi. Anche grandi aziende tecnologiche come Google e OpenAI hanno continuato a migliorare i propri modelli vocali.

Finanziamenti, crescita dei ricavi ed espansione

All'inizio di quest'anno, ElevenLabs ha raccolto 500 milioni di dollari in un round di finanziamento guidato da Sequoia, che ha valutato l'azienda 11 miliardi di dollari. Da allora sono emerse indiscrezioni su un successivo round che potrebbe raddoppiarne la valutazione, portandola a 22 miliardi di dollari.

Il tasso annualizzato dei ricavi dell’azienda è salito da circa 330 milioni di dollari all'inizio dell'anno a oltre 600 milioni di dollari. ElevenLabs ha inoltre intensificato le assunzioni in mercati quali India, Europa e Brasile, portando il proprio organico a oltre 800 dipendenti.

Possibili piani per una IPO

Il cofondatore e CEO Mati Staniszewski ha recentemente dichiarato che ElevenLabs punta a un'offerta pubblica iniziale “nei prossimi anni”, senza tuttavia fornire una tempistica specifica.

2
Live Chat