Голос зі статистичної моделі: HTS
На Eurospeech '99 у Будапешті (5–9 вересня 1999 року) Такайосі Йосімура, Кейіті Токуда та співавтори з Нагойського й Токійського технологічних інститутів описали синтезатор, у якому прихована марковська модель сама породжує спектр, висоту голосу й тривалість звуків. 25 грудня 2002 року їхня група відкрито випустила систему як HTS 1.0.
Чому це важливо
Голос став параметрами моделі, а не бібліотекою записів: його можна навчити на кількастах реченнях, зберігати компактно й змінювати, не записуючи нового диктора. Разом із вибором одиниць це одна з двох ліній синтезу, які WaveNet 2016 року називає своїми попередниками й базами порівняння.
Систему навчено на 450 фонетично збалансованих реченнях японської бази ATR (16 кГц, 25 мел-кепстральних коефіцієнтів із дельтами, HMM на три стани). Висоту змодельовано розподілами на кількох просторах, бо в глухих звуках її немає; спектр, висоту й тривалість кластеризують три окремі дерева рішень — 6 615, 1 877 і 201 листок. Якість перевірено лише неформальним прослуховуванням, чисел немає. HTS 1.0 вийшов латкою до HTK 3.2 під вільною ліцензією без комерційних обмежень (після латки діє ліцензія HTK), без власного аналізатора тексту — його роль грав Festival. Сторінка історії проєкту веде лінію від статті про генерацію параметрів на ICASSP '95; ту статтю не відкрито. Чого запис не стверджує: ліцензія BSD в історії HTS з'являється лише 2008 року, для hts_engine API, а не для HTS 1.0.