Дослідження · березень 2022 р.
InstructGPT і навчання на людських оцінках
OpenAI дообучила модель виконувати прохання, навчивши окрему модель винагороди на людських порівняннях відповідей.
Чому це важливо
Модель на 1,3 мільярда параметрів стала кориснішою за модель на 175 мільярдів — узгодження виявилося важливішим за розмір.
Схема має три кроки: дообчення на прикладах бажаної поведінки, навчання моделі винагороди на ранжуваннях відповідей людьми, потім оптимізація політики за цією винагородою. Результат був не про якість мови, а про те, чи робить модель те, чого просять. Через вісім місяців ця сама схема перетворила GPT-3.5 на ChatGPT — і саме вона, а не розмір, зробила модель придатною для широкого вжитку.
Відомості про подію
- Дата події
- березень 2022 р.
- Дата на часовій лінії
- Дата події
- Перевірка
- Джерела зібрано автоматично · 17 вересня 2026 р.
- Лінії
- ID
- evt-0243
Препринт від 4 березня 2022 року; доповідь на NeurIPS 2022.
Записи, що посилаються на цей
- Пов’язано Alpaca
Той самий результат узгодження, отриманий без людських оцінювачів.
- Пов’язано Claude
Узгодження побудовано на тій самій лінії навчання за людськими вподобаннями.
- Протиставляє Пряма оптимізація вподобань
Той самий результат узгодження без окремої моделі винагороди і без навчання з підкріпленням.
Direct Preference Optimization: Your Language Model is Secretly a Reward Model - Пов’язано o1 і обчислення під час відповіді
Підкріплене навчання застосовано не до вподобань оцінювача, а до правильності розв'язку.
- Протиставляє Модель, яка не пише тексту: TypeSafe випускає Jev
Засновник TypeSafe брав участь у створенні методу з цього запису; спосіб навчання Jev компанія визначає просто проти нього — каліброване рішення замість людської переваги.
A new kind of AI model from a ChatGPT inventor is thrilling developersIntroducing System One Models & Jev - Уможливлює Навчання з людських уподобань
InstructGPT донавчає GPT-3 навчанням з підкріпленням на людському відгуку з посиланням «RLHF; Christiano et al., 2017»; Крістіано — серед авторів InstructGPT.
Training language models to follow instructions with human feedback - Уможливлює Проксимальна оптимізація політики (PPO)
InstructGPT v1 оптимізує політику щодо моделі винагороди «алгоритмом PPO (Schulman et al., 2017)», і самі моделі звуться PPO і PPO-ptx.
Training language models to follow instructions with human feedback - Спирається на Constitutional AI: нешкідливість з відгуку ШІ
InstructGPT названо серед робіт, де навчання з людського відгуку зазвичай використовує щонайменше десятки тисяч людських міток; ця робота замінює мітки нешкідливості оцінками моделі.
Constitutional AI: Harmlessness from AI Feedback (arXiv:2212.08073v1) - Протиставляє OpenAI збирає команду superalignment
Пост називає навчання з людського відгуку чинною технікою узгодження, яка не масштабуватиметься на системи, розумніші за людей, бо спирається на людський нагляд.
Introducing Superalignment (archived copy) - Пов’язано Керівники superalignment залишають OpenAI
Серед досягнень команди Лейке першим називає InstructGPT — першу мовну модель, навчену з людського відгуку.
Jan Leike on X: last day as head of alignment (thread)