Повернутися до часової лінії

Дослідження · 31 січня 2025 р.

Розміщено за датою сучасного події першоджерела. Точна дата події невідома; нижче наведено підтверджений часовий інтервал.

Тисяча прикладів і примусовий бюджет

31 січня 2025 року Стенфорд і Інститут Аллена показали, що міркування вмикається тисячею прикладів. Донавчання Qwen2.5-32B-Instruct на наборі s1K зайняло 26 хвилин на 16 прискорювачах H100, а модель обійшла o1-preview на змагальній математиці на величину до 27 відсотків.

Чому це важливо

Доти здатність міркувати виглядала як наслідок або величезного донавчання, або довгого навчання з підкріпленням. Ця робота показала нижню межу ціни: тисяча відібраних прикладів і півгодини на шістнадцяти прискорювачах, тобто відтворити таку модель стало під силу університетській лабораторії.

Набір s1K — рівно тисяча завдань із ланцюжками міркувань, відібраних за трьома критеріями: складність, різноманітність і якість, кожен перевірено абляцією. Другий прийом — примусовий бюджет: якщо модель хоче зупинитися зарано, їй дописують слово «Wait» і вона міркує далі; якщо міркує задовго, роздуми обривають примусово. Саме це дає приріст на AIME24 з 50,0 до 56,7 відсотка, який у резюме статті округлено до 57. Для порівняння, o1-preview на AIME24 дає 44,6. Чого запис не стверджує. Автори самі називають дві межі прийому: приріст від довшого міркування врешті виходить на плато, а далі впирається в контекстне вікно базової моделі. Тобто примусовий бюджет розтягує те, що модель уже вміє, а не додає їй нового. Порівняння на 27 відсотків стосується змагальної математики, MATH і AIME24, а не завдань узагалі.

Відомості про подію

Дата події
31 січня 2025 р.
Дата на часовій лінії
Дата первинної публікації
Перевірка
Джерела зібрано автоматично · 22 вересня 2026 р.
Лінії
ID
evt-0566

День подання першої версії препринта. Пізніше arXiv додав ще дві; числа прочитано у першій.

Джерела

Пов’язані події

Записи, що посилаються на цей