Повернутися до часової лінії

Дослідження · 15 грудня 2022 р.

Constitutional AI: нешкідливість з відгуку ШІ

15 грудня 2022 року 51 автор з Anthropic на чолі з Юньтао Баєм виклав препринт «Constitutional AI». Асистента навчили бути нешкідливим без жодної людської мітки шкідливих відповідей: людський нагляд зведено до короткого переліку принципів, «конституції», а порівняння відповідей, на яких учиться модель переваг, робить сама модель.

Чому це важливо

Навчання з людського відгуку зазвичай потребувало щонайменше десятків тисяч людських міток; тут мітки нешкідливості замінили оцінками самої моделі, і метод дістав назву RLAIF — навчання з підкріпленням на відгуку ШІ. Результат — асистент, який не ухиляється від шкідливого запиту, а пояснює свої заперечення. Через рік моделі переваг, створені цим методом, використано в навчанні безпеки в Sleeper Agents.

Дві фази: у навчанні з учителем модель критикує й переписує власні відповіді, і на переписаних її донавчають; у фазі підкріплення модель вибирає кращу з двох відповідей, з цих порівнянь тренують модель переваг, і вона стає сигналом винагороди. Обидві фази можуть використовувати міркування ланцюжком. Принципів «близько десяти», і автори пишуть, що обрали їх досить довільно й ітеративно для дослідження, а в майбутньому їх мала б переробити ширша група зацікавлених сторін. Корисність і далі навчали на людських оцінках — без людських міток лише нешкідливість. Числа 16 принципів, яке трапляється в переказах, у статті немає.

Відомості про подію

Дата події
15 грудня 2022 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 25 вересня 2026 р.
Лінії
ID
evt-0717

День єдиної версії препринта arXiv:2212.08073.

Джерела

Пов’язані події

Записи, що посилаються на цей