Qwen3-ASR: відкриті ваги для мовлення
29 січня 2026 року команда Qwen (Alibaba Cloud) випустила Qwen3-ASR у двох розмірах, 0,6B і 1,7B, для розпізнавання мовлення та визначення мови для 52 мов і діалектів, а також Qwen3-ForcedAligner-0.6B для вирівнювання тексту з мовленням; за звітом, за ліцензією Apache 2.0.
Чому це важливо
Розпізнавання мовлення на 52 мовах і діалектах стало доступним із ліцензією, що дозволяє використання й донавчання без домовленості з розробником. Це редакційна оцінка; якість моделі тут не оцінюється, бо незалежного виміру запис не має.
Що кажуть джерела. Репозиторій розробника: реліз 29 січня 2026 року, дві моделі розпізнавання (0,6B і 1,7B) і вирівнювач Qwen3-ForcedAligner-0.6B; ліцензія репозиторію Apache-2.0; 52 мови й діалекти для визначення мови та розпізнавання, 11 мов для вирівнювача. Технічний звіт arXiv:2601.21337 (v1 — 29 січня, v2 — 30 січня 2026): моделі спираються на Qwen3-Omni, вирівнювач — неавторегресійний, моделі випущено за Apache 2.0. Чого запис не стверджує. Твердження розробників про якість — найкращий результат серед відкритих моделей, конкурентність із найсильнішими закритими API, затримка першого токена й швидкість при паралельних запитах — лежать у їхньому власному звіті й не внесені як факти: незалежного виміру не знайдено. Неавторегресійним звіт називає лише вирівнювач, а не саме розпізнавання, як його описав сторонній звіт-джерело. Сторінки моделей на Hugging Face, допис у блозі й PDF звіту не відкривалися.