METR: Opus 5.5 — крок, а не стрибок
22 вересня 2026 року, у день виходу Claude Opus 5.5, METR оприлюднила підсумок передрелізної оцінки: модель трохи сильніше за Claude Fable 5.1 прискорює дослідження ШІ, але навряд чи здатна їх повністю автоматизувати, і на кількісних оцінках це поступове поліпшення, а не стрибок. Окрема команда METR із ширшим доступом до Anthropic оцінила прискорення розвитку спроможностей завдяки ШІ приблизно в 1,5 раза, з імовірністю близько 30 % — удвічі.
Чому це важливо
Величина, про яку досі говорили лише самі лабораторії, — наскільки ШІ вже пришвидшує створення наступного ШІ, — дістала оцінку зовнішньої організації. Оцінка попередня: період, до якого вона належить, не названо, а докази автори підсумку не бачили, і сама METR називає це пробною версією ширшої оцінки.
Оцінку проведено за неоплачуваною угодою; Anthropic могла переглянути й редагувати текст, який увійшов і до системної картки Opus 5.5. Доступ до API тривав 10 робочих днів, задач було п'ять: Budget NanoGPT Speedrun, LMCA, Train a Program, Gaming Bot і Sunlight. METR пише, що модель зберігає якісні слабкості, яких навряд чи припустився б експерт-людина на складних довгих задачах, і що для повної автоматизації досліджень потрібні великі поліпшення в передбаченні й «судженні» дослідника. Anthropic подає Opus 5.5 як модель рівня Fable 5.1 на більшості робіт, на 40 % дешевшу за Opus 5, і як свій перший випуск після заклику сповільнити передову розробку. Чого запис не стверджує: що оцінка METR цілком незалежна від розробника, адже текст погоджено з ним, або що число 1,5 стосується саме розробки Opus 5.5 — METR сама пише, що це невідомо.