Повернутися до часової лінії

Дослідження · червень 2020 р.

wav2vec 2.0

Модель навчалася подавати мовлення на нерозмічених записах, а потім досягала доброї точності, маючи лише десять хвилин розшифрованого звуку.

Чому це важливо

Головна перешкода для більшості мов світу зникла: розпізнавання перестало вимагати тисяч годин ручної розшифровки.

Класичні системи потребували сотень чи тисяч годин транскрибованого мовлення, і саме тому працювали лише для десятка мов. Тут модель спершу вчиться передбачати замасковані ділянки власного звуку без міток, а розмічені дані потрібні тільки для короткого дообчення. Наслідок практичний: розпізнавання стало досяжним для мов, для яких корпусів ніхто ніколи не збирав.

Відомості про подію

Дата події
червень 2020 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 17 вересня 2026 р.
Лінії
ID
evt-0240

Препринт від 20 червня 2020 року; доповідь на NeurIPS 2020.

Джерела

Пов’язані події

Записи, що посилаються на цей