Повернутися до часової лінії

Дослідження · грудень 2014 р.

Deep Speech

Baidu показала систему, де одна мережа перетворює звук на текст без фонем, словників вимови і прихованих марковських моделей.

Чому це важливо

Конвеєр, що складався з чотирьох окремо налаштованих частин, замінили однією навченою функцією.

Класична схема вимагала акустичної моделі, словника вимови, мовної моделі та декодера, і кожну частину налаштовували окремо. Deep Speech навчається наскрізно від спектрограми до символів. Система показала стійкість до шуму, кращу за комерційні продукти. Той самий підхід через вісім років використала Whisper, додавши масштаб даних.

Відомості про подію

Дата події
грудень 2014 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 17 вересня 2026 р.
Лінії
ID
evt-0227

Препринт від 17 грудня 2014 року.

Джерела

Пов’язані події

Записи, що посилаються на цей