Blizzard Challenge: синтез мовлення на спільних даних
На Interspeech 2005 у Лісабоні (4–8 вересня 2005 року) Алан Блек (Карнегі-Меллон) і Кейіті Токуда (Нагойський технологічний інститут) підсумували перше змагання синтезаторів мовлення на спільних даних: шість команд з трьох континентів за тиждень-два збудували голоси з тих самих баз CMU ARCTIC і озвучили ті самі 250 речень. Слухачі оцінювали природність і вписували почуте; першою в усіх групах слухачів стала HMM-система Нагойського інституту.
Чому це важливо
Синтез мовлення дістав те, що розпізнавання мало від 1980-х: спільні дані, однакові тести й порівнянні числа замість демонстрацій кожної лабораторії на власних записах. Жива мова дикторів, записана поряд, показала відстань: жодна система до неї не наблизилася.
Бази CMU ARCTIC — близько 1200 речень на голос із книжок Project Gutenberg, 16 кГц; два голоси були доступні з червня 2004 року, ще два надійшли разом із тестовими реченнями 15 січня 2005-го. П'ять жанрів: новели, новини й розмовні фрази оцінювали за шкалою від 1 до 5, римовані слова й семантично безглузді речення слухачі вписували, і рахували частку помилкових слів. Серед слухачів — експерти від кожної команди, добровольці з інтернету й оплачувані студенти. У експертів жива мова отримала 4,76 бала й 8,5 % помилок, найкраща система — 3,19 і 14,7 %, найслабша — близько 2,1 і 32,7 %. Звіт ховає команди за літерами від A до F, але три з них описали себе самі. Нагойська система HTS на прихованих марковських моделях, за власною статтею, мала найвищі бали й найменше помилок у всіх групах слухачів, а в таблиці звіту першою в усіх стовпцях стоїть лише система D — отже, D це вона. Конкатенативна система IBM, розрахована на значно більші бази, за своєю статтею була другою за балами; вибір одиниць CMU на Festival — система C, «у середині». Нагойська група пояснює перевагу тим, що на базі близько години мовлення HMM краще покриває дані, а вибору одиниць зазвичай потрібно понад 10 годин. Чого запис не стверджує: хто стоїть за рештою літер, жоден прочитаний документ не каже.