Повернутися до часової лінії

Дослідження · березень 2022 р.

InstructGPT і навчання на людських оцінках

OpenAI дообучила модель виконувати прохання, навчивши окрему модель винагороди на людських порівняннях відповідей.

Чому це важливо

Модель на 1,3 мільярда параметрів стала кориснішою за модель на 175 мільярдів — узгодження виявилося важливішим за розмір.

Схема має три кроки: дообчення на прикладах бажаної поведінки, навчання моделі винагороди на ранжуваннях відповідей людьми, потім оптимізація політики за цією винагородою. Результат був не про якість мови, а про те, чи робить модель те, чого просять. Через вісім місяців ця сама схема перетворила GPT-3.5 на ChatGPT — і саме вона, а не розмір, зробила модель придатною для широкого вжитку.

Відомості про подію

Дата події
березень 2022 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 17 вересня 2026 р.
Лінії
ID
evt-0243

Препринт від 4 березня 2022 року; доповідь на NeurIPS 2022.

Джерела

Пов’язані події

Записи, що посилаються на цей