FrontierMath Erdos: 68 нерозв'язаних задач як тест
Epoch AI зібрала бенчмарк із 68 відкритих задач Ердеша, формалізованих у Lean. Із п'яти перевірених моделей лише GPT-6 Astra розв'язала дві.
Чому це важливо
Неформальний рахунок «яку задачу Ердеша закрили цього тижня» замінено фіксованим набором із бюджетом, машинною перевіркою й вартістю за розв'язок.
Публікація від 1 вересня 2026 року. Бенчмарк складається з 68 значущих задач Ердеша, відкритих станом на серпень 2026 року; їх відібрав математик Томас Блум і формалізував у Lean. Кожна модель дістала одну спробу на задачу з бюджетом 300 доларів і 72 годинами роботи. Розв'язала щось лише GPT-6 Astra в передвипусковій версії — дві задачі з 68, тобто 3 відсотки: спростувала задачу 74, знайшовши контрприклад, за 222 долари, і довела задачу 126 за 172 долари. GPT-5.6 Sol, GPT-5.5, Claude Fable 5.1 і Claude Fable 5 отримали по нулю. Epoch зазначає, що досягнення цих п'яти розв'язків коштувало понад 220 тисяч доларів обчислень за всіма спробами разом.