GLUE: дев'ять завдань, один бал, закриті тести
20 квітня 2018 року дослідники з Нью-Йоркського університету зібрали дев'ять наявних задач розуміння мови під один лідерборд із закритими тестовими даними й одним усередненим балом. Найкраща базова лінія самої статті дала 60,3.
Чому це важливо
Доти система вміла одну задачу, і порівняння означало порівняння спеціалістів. Один бал на дев'яти різнорідних задачах зробив узагальнення вимірюваним, а не декларованим: модель, натренована під одне завдання, тепер програвала явно. Саме це число стало тим, на що цілилися попередньо навчені моделі наступних двох років.
Дев'ять завдань: граматична прийнятність (CoLA), тональність (SST-2), перефразування (MRPC, QQP, STS-B) і текстове виведення (MNLI, QNLI, RTE, WNLI). Підсумковий бал — макро-середнє по задачах, а не зважене за обсягом даних, щоб дрібні задачі не зникали за великими. Крім них — окремий діагностичний набір, зроблений уручну, щоб видно було, які саме мовні явища модель тягне. Заявлена риса, якої доти не було: лідерборд стоїть переважно на приватних тестових даних, і систему треба прогнати на всіх дев'яти задачах і надіслати результати, а не показати свої числа. Це і є той закритий тестовий сервер, який часто приписують SQuAD. Найкращий результат у самій статті — 60,3 макро-середнього (BiLSTM з ELMo, навчання на кожну задачу окремо). Автори одразу кажуть висновок: багатозадачне навчання не дало помітного приросту над окремою моделлю на кожну задачу, тобто простір для узагальнення лишається відкритим. Чого в цій публікації немає, попри поширене твердження: людського базового рівня. Пошук по всьому тексту першої версії не дає рядка «87.1» жодного разу. Оцінку людини для GLUE опублікували через рік і в іншій роботі — у статті про SuperGLUE, як «обережні 87,3 %». Дату запису теж варто назвати окремо: перша версія препринта подана 20 квітня 2018 року; другої версії дочекалися аж до 18 вересня, а дати 2 травня 2018 року в історії подань немає взагалі.