o1 і обчислення під час відповіді
OpenAI показала модель, навчену думати перед відповіддю: вона породжує довгий прихований ланцюг міркувань, і чим довше думає, тим точніше відповідає.
Чому це важливо
З'явилася друга вісь зростання — якість почала залежати від часу на роздум, а не тільки від розміру моделі й обсягу навчання.
Модель навчали підкріпленням на задачах із перевірною відповіддю: математика, код, природничі науки. Винагорода йшла за правильний результат, і модель сама виробила звички, схожі на людські — перевіряти себе, повертатися, пробувати інший підхід. На відбірковому іспиті американської математичної олімпіади результат стрибнув із кількох відсотків до вісімдесяти з гаком. Ланцюг міркувань OpenAI сховала, показуючи лише переказ, і це стало предметом критики. Практичний наслідок: вартість відповіді перестала бути сталою, бо тепер за точність платять секундами.