Повернутися до часової лінії

Дослідження · 5 січня 2023 р.

VALL-E: чужий голос із трьох секунд

5 січня 2023 року Ченї Ван і співавтори з Microsoft описали VALL-E — мовну модель над дискретними кодами нейрокодека EnCodec, навчену на 60 000 годин англійського мовлення. Трисекундного запису незнайомого мовця досить, щоб синтезувати будь-який текст його голосом.

Чому це важливо

Синтез мовлення перейняв рецепт великих мовних моделей — масштаб даних і навчання в контексті, — і клонування голосу перестало вимагати записів цільового мовця для навчання. Автори самі назвали ризики: обхід голосової ідентифікації й видавання себе за іншу людину.

Дані — LibriLight, близько 7 000 дикторів. Похибка розпізнавання синтезованого мовлення — 5,9 % проти 7,7 % у найкращої тоді системи YourTTS; у режимі продовження — 3,8 %. Модель зберігає емоцію й акустичне середовище зразка. Запис не стверджує, що модель було випущено: стаття цього не каже.

Відомості про подію

Дата події
5 січня 2023 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 25 вересня 2026 р.
Лінії
ID
evt-0775

День подання першої версії препринта; числа прочитано в ній.

Джерела

Пов’язані події