Повернутися до часової осі

Оголошення · 4 лютого 2026 р.

Hugging Face: результати від спільноти

4 лютого 2026 року Hugging Face запустила Community Evals: набори даних на Hub можуть слугувати рейтингами, моделі самі зберігають свої оцінки, а будь-хто може подати результат для будь-якої моделі запитом на злиття.

Чому це важливо

Результати тестів, розкидані по картках моделей і статтях, стали збирати в одному місці з позначкою, хто їх подав. Редакційна оцінка: це розкриває розбіжності, але не розв’язує насичення тестів.

Що сказано. Набір даних реєструється як тест файлом eval.yaml у форматі Inspect AI й автоматично збирає результати з усього Hub; уже працюють MMLU-Pro, GPQA і HLE, спершу — короткий перелік із чотирьох тестів. Оцінки моделі лежать у файлах .eval_results/*.yaml у її репозиторії; автор моделі може закрити запит чи сховати результат. Будь-який користувач може подати результат для будь-якої моделі, він показується як «спільнотний»; позначки розрізняють подані автором, спільнотою та незалежно перевірені. Чого запис не стверджує. Прочитано лише допис з оголошенням; скільки результатів надійшло, невідомо. Адреса зовнішнього звіту вела на інший допис (30 червня 2026 року про Every Eval Ever), його не використано.

Відомості про подію

Дата події
4 лютого 2026 р.
Дата на часовій осі
Дата події
Перевірка
Джерела зібрано автоматично · 29 вересня 2026 р.
Лінії
ID
evt-0953

Джерела

Пов’язані події

Передумови цієї події ще досліджуються.