Повернутися до часової лінії

Бенчмарк · 15 січня 2026 р.

Підсумковий звіт ARC Prize за 2025 рік

Звіт зафіксував результати змагання: 1455 команд, 15 154 подання, найкращий результат 24 відсотки на приватному наборі ARC-AGI-2. Темою року названо цикл уточнення, а поширення тесту — джерелом нового забруднення.

Чому це важливо

Рік закрився числом, від якого можна рахувати далі, і твердженням авторів, що сам тест псується від того, що його всі взяли за стандарт.

Автори — Франсуа Шолле, Майк Кнуп, Грегорі Камрадт і Браян Ландерс. Змагання на Kaggle зібрало 1455 команд і 15 154 подання, найкращий результат — 24 відсотки на приватному оцінковому наборі ARC-AGI-2. Подань статей стало майже вдвічі більше — 90. Визначальною темою 2025 року названо появу циклу уточнення: ітеративної оптимізації програми під конкретну задачу, керованої сигналом зворотного зв'язку. Чотири передові лабораторії — Anthropic, Google DeepMind, OpenAI і xAI — упродовж 2025 року подавали результати ARC-AGI у публічних картках моделей, що зробило тест галузевим стандартом. Автори водночас стверджують, що поточна продуктивність передових систем лишається обмеженою покриттям знань, і це породжує нові форми забруднення бенчмарку.

Відомості про подію

Дата події
15 січня 2026 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 19 вересня 2026 р.
Лінії
ID
evt-0366

День подання звіту на arXiv.

Джерела

Пов’язані події

Записи, що посилаються на цей