Повернутися до часової лінії

Дослідження · 29 травня 2023 р.

Пряма оптимізація вподобань

Автори показали, що узгодження за людськими вподобаннями зводиться до звичайної функції втрат — без моделі винагороди і без навчання з підкріпленням.

Чому це важливо

Найскладніша частина рецепта ChatGPT спростилася до кількох рядків коду, і узгодження стало доступним малим командам.

Схема InstructGPT вимагала трьох етапів і налаштування навчання з підкріпленням, яке відоме своєю нестабільністю. DPO доводить, що оптимальна політика виражається через модель винагороди аналітично, тому винагороду можна не будувати зовсім. Метод швидко став типовим для відкритих моделей, бо відтворюваний і дешевий.

Відомості про подію

Дата події
29 травня 2023 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 17 вересня 2026 р.
Лінії
ID
evt-0277

Препринт від 29 травня 2023 року; доповідь на NeurIPS 2023.

Джерела

Пов’язані події