Дослідження · вересень 2016 р.
WaveNet
DeepMind навчила мережу породжувати звук відлік за відліком — і синтезоване мовлення вперше перестало відрізнятися від людського на слух.
Чому це важливо
Синтез мовлення після сорока років фільтрів і склеювання фрагментів перейшов на породжувальну модель.
Попередні системи або складали мовлення з записаних шматків, або фільтрували збудження за параметрами — і в обох випадках звучали механічно. WaveNet моделює розподіл кожного наступного відліку за всіма попередніми, використовуючи розширені причинні згортки. Перша версія була надто повільною для практики; через рік оптимізована версія запрацювала в Google Assistant.
Відомості про подію
- Дата події
- вересень 2016 р.
- Дата на часовій лінії
- Дата події
- Перевірка
- Джерела зібрано автоматично · 17 вересня 2026 р.
- Лінії
- ID
- evt-0232
Оголошення від 8 вересня 2016 року.
Записи, що посилаються на цей
- Пов’язано GPT-4o
Породження звуку напряму, без проміжного тексту.
- Пов’язано Moshi
Породження звуку напряму нейронною мережею, вісім років потому.
- Протиставляє Tacotron: мовлення прямо з літер
Автори протиставляють себе WaveNet: той повільний через генерацію по відліку й не наскрізний, бо потребує лінгвістичних ознак від окремого фронтенду; Tacotron генерує по кадру й вчиться з пар «текст — звук».
Tacotron: A Fully End-to-End Text-to-Speech Synthesis Model (arXiv:1703.10135v1) - Спирається на Jukebox: пісні зі співом як сирий звук
Кодери й декодери VQ-VAE Jukebox побудовано із залишкових мереж «у стилі WaveNet»; WaveNet стаття називає попередником авторегресивної генерації сирого звуку.
Jukebox: A Generative Model for Music (arXiv:2005.00341v1) - Уможливлює Вибір одиниць: голос зі шматків запису
WaveNet називає цю статтю серед основ конкатенативного синтезу й бере за базу порівняння систему вибору одиниць.
WaveNet: A Generative Model for Raw Audio (A. van den Oord, S. Dieleman, H. Zen et al.), arXiv:1609.03499v1, 12 September 2016 - Уможливлює Голос зі статистичної моделі: HTS
WaveNet описує статистичний параметричний синтез на HMM із посиланням на дисертацію Йосімури 2002 року й бере параметричну систему за базу порівняння.
WaveNet: A Generative Model for Raw Audio (A. van den Oord, S. Dieleman, H. Zen et al.), arXiv:1609.03499v1, 12 September 2016