Повернутися до часової лінії

Право й регулювання · 19 вересня 2023 р.

Політика відповідального масштабування Anthropic

19 вересня 2023 року Anthropic оприлюднила політику відповідального масштабування (RSP): рівні безпеки ШІ від ASL-1 до ASL-3, побудовані за зразком рівнів біобезпеки, де вищий рівень вимагає суворіших доказів безпеки. Чинні моделі, зокрема Claude, компанія віднесла до ASL-2; ASL-4 і вище ще не визначено.

Чому це важливо

Лабораторія зв'язала подальше масштабування з виміряними небезпечними здібностями: політика неявно вимагає тимчасово зупинити навчання потужніших моделей, якщо масштабування випереджає здатність виконати потрібні заходи. Протягом кількох місяців схожу рамку оприлюднила OpenAI, а 2026 року цю політику переписано у версії 3.0.

ASL-2 — ранні ознаки небезпечних здібностей, наприклад інструкції щодо біозброї, які ще не корисні через ненадійність; ASL-3 — суттєве збільшення ризику катастрофічного зловживання порівняно з пошуковиком чи підручником або низькорівнева автономія. Для ASL-3 компанія зобов'язується не розгортати модель, якщо змагальне тестування найкращими редтімерами покаже значущий ризик зловживання, а заходи ASL-4 написати до досягнення ASL-3. Політику схвалила рада, зміни схвалює рада після консультацій із Long Term Benefit Trust. Рамку ARC Evals компанія називає джерелом натхнення. Застосування: у березні 2024 року Anthropic визначила Claude 3 як ASL-2 «per our Responsible Scaling Policy» — це той самий виробник; незалежної перевірки дотримання не знайдено. Повний документ політики не відкривали, запис стоїть на оголошенні.

Відомості про подію

Дата події
19 вересня 2023 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 25 вересня 2026 р.
Лінії
ID
evt-0718

Дата оголошення Anthropic.

Джерела

Пов’язані події

Записи, що посилаються на цей