gpt-realtime
Мовленнєва модель, що приймає й породжує звук напряму, вийшла із стану передпоказання: з викликом інструментів, зображеннями на вході й телефонними дзвінками.
Чому це важливо
Лінія, що почалася з програми ARPA 1971 року, завершилася сервісом, де тексту між людиною й моделлю вже немає взагалі.
Розпізнавання мовлення як окрема задача трималося пів століття: звук на вході, текст на виході, а далі щось інше. Тут тексту в тракті немає — модель чує і говорить, а текстовий потік лишається тільки як внутрішній слід. Практична частина: підтримка віддалених серверів інструментів, приймання зображень і підключення до телефонної мережі. Тобто голосовий агент міг прийняти дзвінок, подивитися документ і зробити дію — усе в одній сесії.