wav2vec 2.0
Модель навчалася подавати мовлення на нерозмічених записах, а потім досягала доброї точності, маючи лише десять хвилин розшифрованого звуку.
Чому це важливо
Головна перешкода для більшості мов світу зникла: розпізнавання перестало вимагати тисяч годин ручної розшифровки.
Класичні системи потребували сотень чи тисяч годин транскрибованого мовлення, і саме тому працювали лише для десятка мов. Тут модель спершу вчиться передбачати замасковані ділянки власного звуку без міток, а розмічені дані потрібні тільки для короткого дообчення. Наслідок практичний: розпізнавання стало досяжним для мов, для яких корпусів ніхто ніколи не збирав.