Перший звіт Anthropic про ризики
24 лютого 2026 року Anthropic опублікувала «Risk Report: February 2026» — окремий документ, перший за версією 3 політики масштабування: оцінка катастрофічних ризиків усіх її моделей, зокрема внутрішніх, у редагованому вигляді.
Чому це важливо
Розробник опублікував письмову оцінку ризиків усієї своєї діяльності, а не однієї моделі, з обіцянкою повторювати її. Редакційна оцінка: оцінки в документі — самооцінка компанії, а не незалежний висновок.
Що названо в документі. Це не переказ політики, а окремий 104-сторінковий текст, який політика вимагає публікувати раз на 3–6 місяців. Він охоплює всі моделі компанії, зокрема ті, що працюють лише всередині. Чотири категорії ризику й підсумкові оцінки автора: саботаж дослідження безпеки з боку ШІ — «дуже низький, але не нульовий»; автоматизація дослідницької роботи — «дуже низький»; неновітня хімічна й біологічна зброя — «дуже низький, але не нульовий»; нова хімічна й біологічна зброя — «низький, але з суттєвою невизначеністю». Аналіз зосереджено на Claude Opus 4.6. Частину змісту вилучено з міркувань інтелектуальної власності й публічної безпеки. Окремий звіт про ризик саботажу для Opus 4.6 майже збігається з розділом 2. Пізніші редакції. Адреса anthropic.com/feb-2026-risk-report тепер веде на оновлену копію: за журналом змін у ній правки 26 травня 2026 року (після пілотної зовнішньої рецензії METR) і 8 липня 2026 року; запис спирається на оригінальний файл від 24 лютого. Чи це той самий текст, що й політика (evt-0370)? Ні, це окремий документ. Чого запис не стверджує. Жодну оцінку не перевірено за первинними даними компанії; сторонньої оцінки в межах лютого знайти не вдалося. Зовнішній звіт писав, що документ «підтвердив безпечність» системи; документ такого не каже — він оцінює ризик як низький і називає невизначеність.