Повернутися до часової лінії

Дослідження · 20 лютого 2025 р.

Розміщено за датою сучасного події першоджерела. Точна дата події невідома; нижче наведено підтверджений часовий інтервал.

П'ять тисяч головоломок замість корпусу

20 лютого 2025 року дослідники з Microsoft Research Asia показали, що навчання з підкріпленням на правилі працює на дуже малому штучному корпусі. Після п'яти тисяч згенерованих логічних головоломок модель на 7 мільярдів параметрів покращилася на 125 відсотків на AIME і на 38 відсотків на AMC.

Чому це важливо

DeepSeek-R1 показав, що міркування виникає з підкріплення, але на закритих даних і у великому масштабі. Тут те саме відтворено на корпусі, який можна породити процедурно й перевірити правилом, — і виявилося, що вміння переноситься на математику, якої в корпусі не було взагалі.

Корпус — процедурно згенеровані головоломки про лицарів і брехунів, де відповідь перевіряється правилом, а не людиною чи моделлю. Саме тому винагорода тут справді правилова. Найцікавіше в тому, що з'явилося поза корпусом. Модель набула відображення, перевірки себе й підсумовування — жодного з цих умінь у логічному корпусі немає. Перенесення на AIME і AMC, тобто на математичні змагання, стаття називає свідченням того, що підкріплення виробляє абстрактні схеми розв'язування, а не запам'ятовує предметну область. Чого запис не стверджує. Числа 125 і 38 відсотків — це приріст відносно базової моделі, а не абсолютна точність і не порівняння з провідними системами. Масштаб один: 7 мільярдів параметрів.

Відомості про подію

Дата події
20 лютого 2025 р.
Дата на часовій лінії
Дата первинної публікації
Перевірка
Джерела зібрано автоматично · 22 вересня 2026 р.
Лінії
ID
evt-0575

День подання першої й єдиної версії препринта.

Джерела

Пов’язані події