Moshi
Французька лабораторія Kyutai показала розмовну модель, що слухає й говорить одночасно, із затримкою близько 200 мілісекунд, і віддала ваги у відкритий доступ.
Чому це важливо
Розмова з машиною перестала бути обміном репліками по черзі — модель уперше могла перебити й бути перебитою.
Усі попередні голосові системи чекали, доки людина договорить. Moshi тримає два аудіопотоки паралельно: свій і співрозмовника, — тож може почати відповідь раніше, замовкнути, коли її перебивають, вставити підтакування. Усередині працює аудіокодек Mimi і трансформер, що поряд зі звуком породжує текстовий потік — внутрішній монолог, який тримає зміст. Вісім дослідників зробили це за пів року, і на відміну від голосового режиму GPT-4o ваги виклали відкрито. Для лінії розпізнавання мовлення це кінець самої постановки задачі: розпізнавати більше нічого, звук іде в модель як є.