Повернутися до часової лінії

Бенчмарк · 9 червня 2022 р.

Розміщено за датою сучасного події першоджерела. Точна дата події невідома; нижче наведено підтверджений часовий інтервал.

BIG-bench: 204 завдання, зібрані 442 авторами

9 червня 2022 року 442 автори зі 132 установ виклали 204 завдання, свідомо дібрані так, щоб бути за межами того, що моделі вміють. Прогін через розміри від мільйонів до сотень мільярдів параметрів показав, що якість подекуди росте стрибком на певному масштабі, а подекуди цей стрибок дає крихка метрика.

Чому це важливо

Доти набір робила одна група, і те, що вона вважала складним, задавало межу вимірюваного. Відкритий заклик, на який відгукнулися сто тридцять дві установи, зняв цю межу й дав матеріал, на якому стрибок здібностей із масштабом можна не проголошувати, а розкладати на причини. Одна з причин виявилася вимірювальним артефактом.

204 завдання: від логічних парадоксів і криптографії до задач із біології, фізики, розробки програм, дитячого розвитку й соціальної упередженості. Перевіряли моделі GPT від OpenAI, щільні трансформери Google і розріджені моделі, на розмірах від мільйонів до сотень мільярдів параметрів. Окремо групу людей-експертів попросили пройти всі завдання, щоб мати з чим порівнювати. Висновки, як їх формулюють автори: якість і калібрування зростають із масштабом, але в абсолютних числах лишаються поганими, зокрема проти людей; різні родини моделей поводяться напрочуд схоже, з перевагою для розріджених; завдання, де приріст плавний і передбачуваний, зазвичай тримаються на знанні й запам'ятовуванні, а завдання зі стрибком на критичному масштабі — на багатокроковості або на крихких метриках; соціальна упередженість зазвичай зростає з масштабом там, де контекст неоднозначний, і це можна послабити формулюванням запиту. Останні два пункти — те, заради чого цей запис стоїть. Автори самі назвали спосіб вимірювання серед причин «емерджентності», тобто поставили під сумнів частину висновків, які з їхнього ж набору робили. Що запис не стверджує: у першій версії статті немає ні «57 мов», ні BIG-bench Hard. Неанглійські завдання там позначені ключовими словами й полічені інакше: non-English — 16, multilingual — 12, low-resource language — 10, translation — 10. BIG-bench Hard — окрема пізніша робота. Кількість авторів теж залежить від версії: 442 у першій, 450 у нинішній.

Відомості про подію

Дата події
9 червня 2022 р.
Дата на часовій лінії
Дата первинної публікації
Перевірка
Джерела зібрано автоматично · 21 вересня 2026 р.
Лінії
ID
evt-0511

День першої версії препринта за історією подань arXiv. Числа тут читано саме з неї: у пізнішій версії кількість авторів інша.

Джерела

Пов’язані події