Tacotron: мовлення прямо з літер
29 березня 2017 року Юйсюань Ван і співавтори з Google описали Tacotron — модель, яка синтезує мовлення безпосередньо з символів тексту й навчається з нуля на парах «текст — звук». Середня оцінка природності — 3,82 з 5 проти 3,69 у серійної параметричної системи.
Чому це важливо
Синтез мовлення, що складався з фронтенду аналізу тексту, акустичної моделі й вокодера, звівся до однієї мережі, яку можна навчити без знання фонетики. Це відкрило шлях до нейронних голосів, навчених на самих записах.
Навчання — близько 24,6 години внутрішнього запису північноамериканської англійської; хвилю відновлює алгоритм Гріффіна — Ліма. Конкатенативна система в тому самому тесті мала 4,09, тобто Tacotron її не наздогнав. Генерація по кадрах робить модель значно швидшою за методи, що генерують по відліку.