Підсумковий звіт ARC Prize за 2025 рік
Звіт зафіксував результати змагання: 1455 команд, 15 154 подання, найкращий результат 24 відсотки на приватному наборі ARC-AGI-2. Темою року названо цикл уточнення, а поширення тесту — джерелом нового забруднення.
Чому це важливо
Рік закрився числом, від якого можна рахувати далі, і твердженням авторів, що сам тест псується від того, що його всі взяли за стандарт.
Автори — Франсуа Шолле, Майк Кнуп, Грегорі Камрадт і Браян Ландерс. Змагання на Kaggle зібрало 1455 команд і 15 154 подання, найкращий результат — 24 відсотки на приватному оцінковому наборі ARC-AGI-2. Подань статей стало майже вдвічі більше — 90. Визначальною темою 2025 року названо появу циклу уточнення: ітеративної оптимізації програми під конкретну задачу, керованої сигналом зворотного зв'язку. Чотири передові лабораторії — Anthropic, Google DeepMind, OpenAI і xAI — упродовж 2025 року подавали результати ARC-AGI у публічних картках моделей, що зробило тест галузевим стандартом. Автори водночас стверджують, що поточна продуктивність передових систем лишається обмеженою покриттям знань, і це породжує нові форми забруднення бенчмарку.