SuperGLUE: набір, зроблений на роки, протримався двадцять місяців
2 травня 2019 року автори GLUE визнали власний набір вичерпаним і випустили складніший, лишивши з дев'яти завдань два. Людську оцінку вклали в сам випуск: 89,6 проти 69,7 у найкращої базової лінії. 6 січня 2021 року DeBERTa стояла нагорі з 90,3.
Чому це важливо
Доти термін придатності тестового набору ніхто не міряв, бо не було двох наборів від тих самих людей з тією самою процедурою. Тут він виміряний: двадцять місяців від випуску до подолання, за одну зміну покоління моделей. Відтоді набір довелося планувати як річ, що псується, а не як шкалу.
Перша версія препринта — та, на яку датовано цей запис, — несе в таблиці результатів шість завдань: CB, COPA, MultiRC, RTE, WiC і WSC. Її власна проза каже «сім», а перелік змін каже «лишили два з дев'яти й додали чотири нові», тобто шість; джерело розходиться саме з собою, і саме тому впевненість тут середня. BoolQ і ReCoRD, разом із восьмим завданням, з'являються у версії, опублікованій пізніше. Числа першої версії: людська оцінка макро-середнім 89,6, BERT 66,6, BERT++ 69,7. Словами автори підсумовують розрив як «близько 20 пунктів». Найбільше відставання — на схемах Вінограда, 32,5 пункта; найменше — на CB, RTE і WiC: 11,8, 10,9 і 9,6. Опублікована версія несе вісім завдань і переставляє людську оцінку на 89,8. Дата подолання взята не з лідерборда, а з першоджерела, яке його цитує: анотація DeBERTa каже, що одинична модель уперше перейшла людське макро-середнє з 89,9 проти 89,8, а ансамбль «стоїть нагорі лідерборда SuperGLUE станом на 6 січня 2021 року» з 90,3 проти 89,8. Тут же вперше опубліковано й людську оцінку для GLUE, якої в самому GLUE не було: «обережні 87,3 %» непрофесійної людини. Тобто людський рівень для набору 2018 року з'явився через рік і в чужій статті. Твердження про 90,0 в T5 з Meena перевірити не вдалося, і запис його не несе.