Constitutional AI: нешкідливість з відгуку ШІ
15 грудня 2022 року 51 автор з Anthropic на чолі з Юньтао Баєм виклав препринт «Constitutional AI». Асистента навчили бути нешкідливим без жодної людської мітки шкідливих відповідей: людський нагляд зведено до короткого переліку принципів, «конституції», а порівняння відповідей, на яких учиться модель переваг, робить сама модель.
Чому це важливо
Навчання з людського відгуку зазвичай потребувало щонайменше десятків тисяч людських міток; тут мітки нешкідливості замінили оцінками самої моделі, і метод дістав назву RLAIF — навчання з підкріпленням на відгуку ШІ. Результат — асистент, який не ухиляється від шкідливого запиту, а пояснює свої заперечення. Через рік моделі переваг, створені цим методом, використано в навчанні безпеки в Sleeper Agents.
Дві фази: у навчанні з учителем модель критикує й переписує власні відповіді, і на переписаних її донавчають; у фазі підкріплення модель вибирає кращу з двох відповідей, з цих порівнянь тренують модель переваг, і вона стає сигналом винагороди. Обидві фази можуть використовувати міркування ланцюжком. Принципів «близько десяти», і автори пишуть, що обрали їх досить довільно й ітеративно для дослідження, а в майбутньому їх мала б переробити ширша група зацікавлених сторін. Корисність і далі навчали на людських оцінках — без людських міток лише нешкідливість. Числа 16 принципів, яке трапляється в переказах, у статті немає.