Повернутися до часової лінії

Дослідження · 5–9 вересня 1999 р.

Голос зі статистичної моделі: HTS

На Eurospeech '99 у Будапешті (5–9 вересня 1999 року) Такайосі Йосімура, Кейіті Токуда та співавтори з Нагойського й Токійського технологічних інститутів описали синтезатор, у якому прихована марковська модель сама породжує спектр, висоту голосу й тривалість звуків. 25 грудня 2002 року їхня група відкрито випустила систему як HTS 1.0.

Чому це важливо

Голос став параметрами моделі, а не бібліотекою записів: його можна навчити на кількастах реченнях, зберігати компактно й змінювати, не записуючи нового диктора. Разом із вибором одиниць це одна з двох ліній синтезу, які WaveNet 2016 року називає своїми попередниками й базами порівняння.

Систему навчено на 450 фонетично збалансованих реченнях японської бази ATR (16 кГц, 25 мел-кепстральних коефіцієнтів із дельтами, HMM на три стани). Висоту змодельовано розподілами на кількох просторах, бо в глухих звуках її немає; спектр, висоту й тривалість кластеризують три окремі дерева рішень — 6 615, 1 877 і 201 листок. Якість перевірено лише неформальним прослуховуванням, чисел немає. HTS 1.0 вийшов латкою до HTK 3.2 під вільною ліцензією без комерційних обмежень (після латки діє ліцензія HTK), без власного аналізатора тексту — його роль грав Festival. Сторінка історії проєкту веде лінію від статті про генерацію параметрів на ICASSP '95; ту статтю не відкрито. Чого запис не стверджує: ліцензія BSD в історії HTS з'являється лише 2008 року, для hts_engine API, а не для HTS 1.0.

Відомості про подію

Дата події
5 вересня 1999 р. – 9 вересня 1999 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 25 вересня 2026 р.
Лінії
ID
evt-0824

Дні Eurospeech '99 у Будапешті за колонтитулом статті; відкритий випуск HTS 1.0 — 25 грудня 2002 року за його README.

Джерела

Пов’язані події

Записи, що посилаються на цей