Повернутися до часової лінії

Дослідження · 21 травня 2024 р.

Розміщено за датою сучасного події першоджерела. Точна дата події невідома; нижче наведено підтверджений часовий інтервал.

Ознаки, витягнуті з робочої моделі

21 травня 2024 року Anthropic розклала активації Claude 3 Sonnet розрідженими автокодувальниками й дістала мільйони ознак, кожна з яких відповідає одному зрозумілому поняттю. Примусова активація ознаки змінювала поведінку моделі без жодної зміни ваг.

Чому це важливо

Доти словникове навчання показували на одношаровій іграшковій мережі, і головним сумнівом було, чи воно взагалі масштабується. Тут його застосували до моделі, яка стоїть у продажу, — і ознаки виявилися не лише читними, а й причинними: за них можна потягнути.

Автокодувальники навчено на активаціях залишкового потоку посередині мережі — вибір пояснено тим, що там менша розмірність, ніж у шарі MLP, і що середина ймовірно тримає абстрактніші поняття. Розмірів три: 1 048 576, 4 194 304 і 33 554 432 ознаки. Прив'язка до реального втручання: ознака мосту Золота Брама (34M/31164353), затиснута на десятикратному максимумі активації, змушує модель говорити про міст у будь-якому контексті. Окремий результат — ознаки спрацьовують і на відповідних зображеннях, хоча словникове навчання велося лише на тексті. Запис не стверджує, що знайдені ознаки безпеки щось кажуть про небезпечність моделі. Автори прямо застерігають від такого читання: «є різниця між тим, щоб знати про брехню, бути здатним брехати й брехати насправді». Знайдено ознаки небезпечного коду, упередження, підлабузництва, обману й прагнення влади, злочинного вмісту — і стаття наголошує, що цікавим є не їхнє існування, а те, що їх можна знайти й на них впливати.

Відомості про подію

Дата події
21 травня 2024 р.
Дата на часовій лінії
Дата первинної публікації
Перевірка
Джерела зібрано автоматично · 21 вересня 2026 р.
Лінії
ID
evt-0537

Дата, яку називає сама сторінка публікації: «Published May 21, 2024».

Джерела

Пов’язані події

Записи, що посилаються на цей