Whisper
OpenAI виклала у відкритий доступ модель, навчену на 680 тисячах годин різномовного звуку з вебу, що розшифровує 99 мов і перекладає англійською.
Чому це важливо
Розпізнавання мовлення стало безкоштовним, багатомовним і стійким до шуму — і на цьому лінія, розпочата 1971 року, практично закрилася.
Ставку зробили не на чистоту даних, а на їхню різноманітність: записи з вебу з недосконалими субтитрами замість студійних корпусів. Через це модель добре тримає акценти, шум і фонову музику — саме там, де системи, навчені на Switchboard, ламалися. Відкриті ваги означали, що розшифровка перестала потребувати ні хмари, ні передплати. Від програми ARPA до цього минуло п'ятдесят один рік. Скільки мов. Стаття, прийнята на ICML 2023, рахує 117 тисяч годин неанглійського звуку, що покривають 96 інших мов, тобто 97 разом з англійською; рядка «99» у ній немає. Картка моделі в репозиторії OpenAI каже про 98 інших мов. Число 99 у резюме походить із власних матеріалів OpenAI до релізу; три підрахунки різняться тим, що саме рахують, і жоден із них не є незалежним виміром.