Тисяча прикладів і примусовий бюджет
31 січня 2025 року Стенфорд і Інститут Аллена показали, що міркування вмикається тисячею прикладів. Донавчання Qwen2.5-32B-Instruct на наборі s1K зайняло 26 хвилин на 16 прискорювачах H100, а модель обійшла o1-preview на змагальній математиці на величину до 27 відсотків.
Чому це важливо
Доти здатність міркувати виглядала як наслідок або величезного донавчання, або довгого навчання з підкріпленням. Ця робота показала нижню межу ціни: тисяча відібраних прикладів і півгодини на шістнадцяти прискорювачах, тобто відтворити таку модель стало під силу університетській лабораторії.
Набір s1K — рівно тисяча завдань із ланцюжками міркувань, відібраних за трьома критеріями: складність, різноманітність і якість, кожен перевірено абляцією. Другий прийом — примусовий бюджет: якщо модель хоче зупинитися зарано, їй дописують слово «Wait» і вона міркує далі; якщо міркує задовго, роздуми обривають примусово. Саме це дає приріст на AIME24 з 50,0 до 56,7 відсотка, який у резюме статті округлено до 57. Для порівняння, o1-preview на AIME24 дає 44,6. Чого запис не стверджує. Автори самі називають дві межі прийому: приріст від довшого міркування врешті виходить на плато, а далі впирається в контекстне вікно базової моделі. Тобто примусовий бюджет розтягує те, що модель уже вміє, а не додає їй нового. Порівняння на 27 відсотків стосується змагальної математики, MATH і AIME24, а не завдань узагалі.