Повернутися до часової лінії

Доступність · 3 липня – 17 вересня 2024 р.

Moshi

Французька лабораторія Kyutai показала розмовну модель, що слухає й говорить одночасно, із затримкою близько 200 мілісекунд, і віддала ваги у відкритий доступ.

Чому це важливо

Розмова з машиною перестала бути обміном репліками по черзі — модель уперше могла перебити й бути перебитою.

Усі попередні голосові системи чекали, доки людина договорить. Moshi тримає два аудіопотоки паралельно: свій і співрозмовника, — тож може почати відповідь раніше, замовкнути, коли її перебивають, вставити підтакування. Усередині працює аудіокодек Mimi і трансформер, що поряд зі звуком породжує текстовий потік — внутрішній монолог, який тримає зміст. Вісім дослідників зробили це за пів року, і на відміну від голосового режиму GPT-4o ваги виклали відкрито. Для лінії розпізнавання мовлення це кінець самої постановки задачі: розпізнавати більше нічого, звук іде в модель як є.

Відомості про подію

Дата події
3 липня 2024 р. – 17 вересня 2024 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 18 вересня 2026 р.
Лінії
ID
evt-0304

Модель показали в Парижі 3 липня 2024 року; технічний звіт і ваги оприлюднили у вересні.

Джерела

Пов’язані події

Записи, що посилаються на цей