Політика відповідального масштабування Anthropic
19 вересня 2023 року Anthropic оприлюднила політику відповідального масштабування (RSP): рівні безпеки ШІ від ASL-1 до ASL-3, побудовані за зразком рівнів біобезпеки, де вищий рівень вимагає суворіших доказів безпеки. Чинні моделі, зокрема Claude, компанія віднесла до ASL-2; ASL-4 і вище ще не визначено.
Чому це важливо
Лабораторія зв'язала подальше масштабування з виміряними небезпечними здібностями: політика неявно вимагає тимчасово зупинити навчання потужніших моделей, якщо масштабування випереджає здатність виконати потрібні заходи. Протягом кількох місяців схожу рамку оприлюднила OpenAI, а 2026 року цю політику переписано у версії 3.0.
ASL-2 — ранні ознаки небезпечних здібностей, наприклад інструкції щодо біозброї, які ще не корисні через ненадійність; ASL-3 — суттєве збільшення ризику катастрофічного зловживання порівняно з пошуковиком чи підручником або низькорівнева автономія. Для ASL-3 компанія зобов'язується не розгортати модель, якщо змагальне тестування найкращими редтімерами покаже значущий ризик зловживання, а заходи ASL-4 написати до досягнення ASL-3. Політику схвалила рада, зміни схвалює рада після консультацій із Long Term Benefit Trust. Рамку ARC Evals компанія називає джерелом натхнення. Застосування: у березні 2024 року Anthropic визначила Claude 3 як ASL-2 «per our Responsible Scaling Policy» — це той самий виробник; незалежної перевірки дотримання не знайдено. Повний документ політики не відкривали, запис стоїть на оголошенні.