GPT-4o
OpenAI випустила модель, навчену на тексті, звуку й зображенні одночасно; вона відповідала голосом із затримкою близько третини секунди.
Чому це важливо
Голосова розмова з машиною вперше пішла в темпі людської — бо зникли три окремі моделі, між якими губилися інтонація й час.
Доти голосовий режим складався з розпізнавача, мовної моделі й синтезатора. Кожна ланка додавала затримку, а головне — розпізнавач віддавав лише слова, і все інше, тон, паузи, сміх, кілька голосів у кімнаті, до моделі не доходило. Єдина мережа, навчена на звуці напряму, чує це все і може відповісти інтонацією. Літера o в назві означає omni. Модель також стала безкоштовною для більшості користувачів ChatGPT, і це вперше зробило передовий рубіж доступним без оплати.