Пряма оптимізація вподобань
Автори показали, що узгодження за людськими вподобаннями зводиться до звичайної функції втрат — без моделі винагороди і без навчання з підкріпленням.
Чому це важливо
Найскладніша частина рецепта ChatGPT спростилася до кількох рядків коду, і узгодження стало доступним малим командам.
Схема InstructGPT вимагала трьох етапів і налаштування навчання з підкріпленням, яке відоме своєю нестабільністю. DPO доводить, що оптимальна політика виражається через модель винагороди аналітично, тому винагороду можна не будувати зовсім. Метод швидко став типовим для відкритих моделей, бо відтворюваний і дешевий.