Ознаки, витягнуті з робочої моделі
21 травня 2024 року Anthropic розклала активації Claude 3 Sonnet розрідженими автокодувальниками й дістала мільйони ознак, кожна з яких відповідає одному зрозумілому поняттю. Примусова активація ознаки змінювала поведінку моделі без жодної зміни ваг.
Чому це важливо
Доти словникове навчання показували на одношаровій іграшковій мережі, і головним сумнівом було, чи воно взагалі масштабується. Тут його застосували до моделі, яка стоїть у продажу, — і ознаки виявилися не лише читними, а й причинними: за них можна потягнути.
Автокодувальники навчено на активаціях залишкового потоку посередині мережі — вибір пояснено тим, що там менша розмірність, ніж у шарі MLP, і що середина ймовірно тримає абстрактніші поняття. Розмірів три: 1 048 576, 4 194 304 і 33 554 432 ознаки. Прив'язка до реального втручання: ознака мосту Золота Брама (34M/31164353), затиснута на десятикратному максимумі активації, змушує модель говорити про міст у будь-якому контексті. Окремий результат — ознаки спрацьовують і на відповідних зображеннях, хоча словникове навчання велося лише на тексті. Запис не стверджує, що знайдені ознаки безпеки щось кажуть про небезпечність моделі. Автори прямо застерігають від такого читання: «є різниця між тим, щоб знати про брехню, бути здатним брехати й брехати насправді». Знайдено ознаки небезпечного коду, упередження, підлабузництва, обману й прагнення влади, злочинного вмісту — і стаття наголошує, що цікавим є не їхнє існування, а те, що їх можна знайти й на них впливати.