Повернутися до часової лінії

Дослідження · 20 липня 2017 р.

Проксимальна оптимізація політики (PPO)

20 липня 2017 року Джон Шульман, Філіп Вольський, Прафулла Дхарівал, Алек Редфорд і Олег Клімов з OpenAI виклали проксимальну оптимізацію політики: сурогатну цільову функцію, яка обрізає відношення ймовірностей нової й старої політики (в експериментах ε = 0,2), тож ту саму вибірку можна використати для кількох епох оновлень мініпакетами лише методами першого порядку. На семи задачах MuJoCo по мільйону кроків PPO перевершив попередні методи градієнта політики майже скрізь; на 49 іграх Atari виграв 30 за середньою винагородою за навчання проти 18 в ACER і однієї в A2C.

Чому це важливо

Стабільність оптимізації в довірчій області стала доступною без її машинерії другого порядку, у методі, сумісному зі спільними мережами політики й цінності та з dropout. InstructGPT 2022 року навчав свої моделі алгоритмом PPO (Schulman et al., 2017) і назвав їх PPO та PPO-ptx; GRPO 2024 року описує себе як варіант PPO.

PPO походить від оптимізації політики в довірчій області (TRPO; Шульман, Левін, Моріц, Джордан і Аббіл, Каліфорнійський університет у Берклі, arXiv:1502.05477, перша версія 19 лютого 2015 року), яку стаття про PPO називає відносно складною й несумісною з архітектурами, що містять шум на кшталт dropout або спільні параметри. Результат на Atari залежить від мірила: за середньою винагородою за останні 100 епізодів ACER виграє 28 ігор, а PPO — 19. Числа — з першої версії.

Відомості про подію

Дата події
20 липня 2017 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 24 вересня 2026 р.
Лінії
ID
evt-0667

Перша з двох версій препринта arXiv:1707.06347, 20 липня 2017 року; друга — 28 серпня 2017. Попередник, TRPO (arXiv:1502.05477), — 19 лютого 2015 року.

Джерела

Пов’язані події