Повернутися до часової лінії

Оголошення · 12 вересня 2024 р.

o1 і обчислення під час відповіді

OpenAI показала модель, навчену думати перед відповіддю: вона породжує довгий прихований ланцюг міркувань, і чим довше думає, тим точніше відповідає.

Чому це важливо

З'явилася друга вісь зростання — якість почала залежати від часу на роздум, а не тільки від розміру моделі й обсягу навчання.

Модель навчали підкріпленням на задачах із перевірною відповіддю: математика, код, природничі науки. Винагорода йшла за правильний результат, і модель сама виробила звички, схожі на людські — перевіряти себе, повертатися, пробувати інший підхід. На відбірковому іспиті американської математичної олімпіади результат стрибнув із кількох відсотків до вісімдесяти з гаком. Ланцюг міркувань OpenAI сховала, показуючи лише переказ, і це стало предметом критики. Практичний наслідок: вартість відповіді перестала бути сталою, бо тепер за точність платять секундами.

Відомості про подію

Дата події
12 вересня 2024 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 18 вересня 2026 р.
Лінії
ID
evt-0308

Оголошення від 12 вересня 2024 року.

Джерела

Пов’язані події

Записи, що посилаються на цей