Повернутися до часової лінії

Доступність · 13 травня 2024 р.

GPT-4o

OpenAI випустила модель, навчену на тексті, звуку й зображенні одночасно; вона відповідала голосом із затримкою близько третини секунди.

Чому це важливо

Голосова розмова з машиною вперше пішла в темпі людської — бо зникли три окремі моделі, між якими губилися інтонація й час.

Доти голосовий режим складався з розпізнавача, мовної моделі й синтезатора. Кожна ланка додавала затримку, а головне — розпізнавач віддавав лише слова, і все інше, тон, паузи, сміх, кілька голосів у кімнаті, до моделі не доходило. Єдина мережа, навчена на звуці напряму, чує це все і може відповісти інтонацією. Літера o в назві означає omni. Модель також стала безкоштовною для більшості користувачів ChatGPT, і це вперше зробило передовий рубіж доступним без оплати.

Відомості про подію

Дата події
13 травня 2024 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 18 вересня 2026 р.
Лінії
ID
evt-0299

Оголошення від 13 травня 2024 року.

Джерела

Пов’язані події

Записи, що посилаються на цей