Повернутися до часової лінії

Дослідження · 5 лютого 2024 р.

Розміщено за датою сучасного події першоджерела. Точна дата події невідома; нижче наведено підтверджений часовий інтервал.

GRPO: навчання з підкріпленням без критика

5 лютого 2024 року DeepSeek описала Group Relative Policy Optimization — варіант PPO, який відмовляється від моделі-критика й бере базову лінію з розкиду оцінок у групі відповідей на той самий запит. Точність на MATH зросла з 46,8 % до 51,7 %.

Чому це важливо

Критик у PPO — це друга мережа завбільшки з саму модель, і саме вона робила навчання з підкріпленням дорогим. Відмова від неї здешевила той різновид донавчання, яким через рік навчать DeepSeek-R1.

Числа з першої версії препринта: базова модель DeepSeekMath-Base 7B дає 36,2 % на MATH і цим обходить закриту Minerva 540B, модель у 77 разів більшу. Після SFT (DeepSeekMath-Instruct 7B) — 46,8 %, після фази з підкріпленням за GRPO (DeepSeekMath-RL 7B) — 51,7 %, а на GSM8K 82,9 % → 88,2 %. Стаття каже, що це «наближається» до рівня GPT-4 і Gemini-Ultra, а не дорівнює йому. Що запис не стверджує. Ця робота не запровадила винагороду, яку перевіряє програма: слова «verifiable» в тексті немає жодного разу, а фаза з підкріпленням користується навченою моделлю винагороди на основі DeepSeekMath-Base 7B. GRPO прибирає критика — оцінювача стану всередині PPO, — а не модель винагороди; це різні складові, і плутати їх означає приписати статті чуже досягнення. Правило замість моделі винагороди з'явиться пізніше, у DeepSeek-R1. Величини заощадження пам'яті стаття не називає: там сказано лише, що критик — «модель, порівнянна за розміром із політикою», і що відмова від неї помітно зменшує витрати.

Відомості про подію

Дата події
5 лютого 2024 р.
Дата на часовій лінії
Дата первинної публікації
Перевірка
Джерела зібрано автоматично · 21 вересня 2026 р.
Лінії
ID
evt-0528

День подання першої версії препринта. Друга вийшла наступного дня, третя — 27 квітня 2024 року; числа прочитано у першій.

Джерела

Пов’язані події

Записи, що посилаються на цей