VALL-E: чужий голос із трьох секунд
5 січня 2023 року Ченї Ван і співавтори з Microsoft описали VALL-E — мовну модель над дискретними кодами нейрокодека EnCodec, навчену на 60 000 годин англійського мовлення. Трисекундного запису незнайомого мовця досить, щоб синтезувати будь-який текст його голосом.
Чому це важливо
Синтез мовлення перейняв рецепт великих мовних моделей — масштаб даних і навчання в контексті, — і клонування голосу перестало вимагати записів цільового мовця для навчання. Автори самі назвали ризики: обхід голосової ідентифікації й видавання себе за іншу людину.
Дані — LibriLight, близько 7 000 дикторів. Похибка розпізнавання синтезованого мовлення — 5,9 % проти 7,7 % у найкращої тоді системи YourTTS; у режимі продовження — 3,8 %. Модель зберігає емоцію й акустичне середовище зразка. Запис не стверджує, що модель було випущено: стаття цього не каже.