Британський інститут міряє кібератаки ШІ
Інститут безпеки ШІ Британії описав випробування семи моделей (серпень 2024 – лютий 2026) на двох змодельованих мережах: на 32-кроковій корпоративній атаці Opus 4.6 у середньому проходить 9,8 кроку за 10 млн токенів проти 1,7 у GPT-4o.
Чому це важливо
З’явилося незалежне вимірювання того, як далеко моделі просуваються в довгому ланцюжку кібератаки, а не в окремих задачах. Редакційна оцінка: це перша в атласі така оцінка для Opus 4.6 не від його виробника.
Що названо. Два «кіберполігони» без активного захисту: «The Last Ones» — 32 кроки корпоративної мережі, оцінка людини-експерта близько 14 годин; «Cooling Tower» — 7 кроків атаки на систему керування охолодною вежею, близько 15 годин. Порівняно сім моделей. На першому полігоні при 10 млн токенів середнє — 1,7 кроку в GPT-4o (серпень 2024) і 9,8 в Opus 4.6 (лютий 2026); при 100 млн токенів Opus 4.5 — 11,0, Opus 4.6 — 15,6. Найкращий окремий прогін Opus 4.6 — 22 кроки з 32, приблизно 6 із 14 годин людини. Зростання з 10 до 100 млн токенів дає до 59% без виходу на плато; спроба на 100 млн токенів з Opus 4.6 коштує близько 80 доларів. На другому полігоні за 10 млн токенів більшість моделей не проходять жодного кроку, за 100 млн Opus 4.6 у середньому 1,4 кроку, а GPT-5.3 Codex має один прогін на 3 із 7. Деякі моделі знайшли непередбачений шлях і минули початок ланцюжка; інститут виправив полігон для основних прогонів. Чого запис не стверджує. Повного тексту статті (arXiv:2603.11214) не читано, лише допис блогу. Полігони не мають активних захисників, тож це сила нападу без відсічі, а не результат у реальній мережі. Дата «лютий» у зовнішньому звіті хибна: допис — 16 березня, стаття — 11 березня.