Навчання з людських уподобань
12 червня 2017 року Пол Крістіано й Даріо Амодей з OpenAI, Ян Лайке, Мільян Мартич і Шейн Легг з DeepMind та Том Браун виклали метод, у якому людина порівнює пари коротких відрізків траєкторії агента, модель винагороди підганяється під ці вибори, а агент учиться з підкріпленням на передбаченій винагороді. На восьми задачах робототехніки в MuJoCo і семи іграх Atari метод працював без доступу до функції винагороди, з людським відгуком менш ніж на 1 % взаємодій агента із середовищем.
Чому це важливо
Мету, яку не можна записати як функцію винагороди, стало можливо передати через порівняння, зроблені не-експертами, ціною, яку автори оцінюють приблизно в годину людського часу на нову поведінку. Це і є навчання з підкріпленням на людському відгуку, на яке InstructGPT посилається (Christiano et al., 2017), коли 2022 року донавчає GPT-3 на людських уподобаннях.
З 700 запитами до людини-оцінювача метод майже зрівнявся з навчанням на справжній винагороді в задачах MuJoCo; ігри Atari використали 5500 запитів. Робот Hopper навчився серії сальто назад — поведінки без функції винагороди — з 900 запитів менш ніж за годину. Політики навчено TRPO для робототехніки й A2C, синхронною формою A3C, для Atari. Том Браун у блоці авторів зазначений без установи.