GRPO: навчання з підкріпленням без критика
5 лютого 2024 року DeepSeek описала Group Relative Policy Optimization — варіант PPO, який відмовляється від моделі-критика й бере базову лінію з розкиду оцінок у групі відповідей на той самий запит. Точність на MATH зросла з 46,8 % до 51,7 %.
Чому це важливо
Критик у PPO — це друга мережа завбільшки з саму модель, і саме вона робила навчання з підкріпленням дорогим. Відмова від неї здешевила той різновид донавчання, яким через рік навчать DeepSeek-R1.
Числа з першої версії препринта: базова модель DeepSeekMath-Base 7B дає 36,2 % на MATH і цим обходить закриту Minerva 540B, модель у 77 разів більшу. Після SFT (DeepSeekMath-Instruct 7B) — 46,8 %, після фази з підкріпленням за GRPO (DeepSeekMath-RL 7B) — 51,7 %, а на GSM8K 82,9 % → 88,2 %. Стаття каже, що це «наближається» до рівня GPT-4 і Gemini-Ultra, а не дорівнює йому. Що запис не стверджує. Ця робота не запровадила винагороду, яку перевіряє програма: слова «verifiable» в тексті немає жодного разу, а фаза з підкріпленням користується навченою моделлю винагороди на основі DeepSeekMath-Base 7B. GRPO прибирає критика — оцінювача стану всередині PPO, — а не модель винагороди; це різні складові, і плутати їх означає приписати статті чуже досягнення. Правило замість моделі винагороди з'явиться пізніше, у DeepSeek-R1. Величини заощадження пам'яті стаття не називає: там сказано лише, що критик — «модель, порівнянна за розміром із політикою», і що відмова від неї помітно зменшує витрати.