Повернутися до часової лінії

Дослідження · 29 березня 2017 р.

Tacotron: мовлення прямо з літер

29 березня 2017 року Юйсюань Ван і співавтори з Google описали Tacotron — модель, яка синтезує мовлення безпосередньо з символів тексту й навчається з нуля на парах «текст — звук». Середня оцінка природності — 3,82 з 5 проти 3,69 у серійної параметричної системи.

Чому це важливо

Синтез мовлення, що складався з фронтенду аналізу тексту, акустичної моделі й вокодера, звівся до однієї мережі, яку можна навчити без знання фонетики. Це відкрило шлях до нейронних голосів, навчених на самих записах.

Навчання — близько 24,6 години внутрішнього запису північноамериканської англійської; хвилю відновлює алгоритм Гріффіна — Ліма. Конкатенативна система в тому самому тесті мала 4,09, тобто Tacotron її не наздогнав. Генерація по кадрах робить модель значно швидшою за методи, що генерують по відліку.

Відомості про подію

Дата події
29 березня 2017 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 25 вересня 2026 р.
Лінії
ID
evt-0772

День подання першої версії препринта; числа прочитано в ній. Друга версія 6 квітня 2017 року змінила назву на «Tacotron: Towards End-to-End Speech Synthesis».

Джерела

Пов’язані події

Записи, що посилаються на цей