Deep Speech
Baidu показала систему, де одна мережа перетворює звук на текст без фонем, словників вимови і прихованих марковських моделей.
Чому це важливо
Конвеєр, що складався з чотирьох окремо налаштованих частин, замінили однією навченою функцією.
Класична схема вимагала акустичної моделі, словника вимови, мовної моделі та декодера, і кожну частину налаштовували окремо. Deep Speech навчається наскрізно від спектрограми до символів. Система показала стійкість до шуму, кращу за комерційні продукти. Той самий підхід через вісім років використала Whisper, додавши масштаб даних.