SQuAD 2.0: питання, на яке правильно мовчати
11 червня 2018 року до SQuAD дописали 53 775 питань, на які абзац відповіді не містить, складених краудворкерами так, щоб вони скидалися на відповідні. Найкраща модель упала з 85,8 до 66,3 F1, тоді як людина трималася на 89,5.
Чому це важливо
Доти висока оцінка на розумінні тексту означала вміння знайти в абзаці найсхожіший відрізок, і це вміння вже перевершило людину. Набір, у якому третина питань не має відповіді, вперше зробив відмову вимірюваною й показав числом, що моделі її не мають: розрив із людиною стрибнув з 5,4 до 23,2 пункта за одну зміну умови.
53 775 нових питань складали краудворкери, дивлячись на абзац і вигадуючи питання, на яке в ньому відповіді немає, але є правдоподібний відрізок, який на неї схожий. Щоб мати добрий бал, система мусить не лише знаходити відповідь, а й утримуватися, коли абзац її не підтверджує. Числа з таблиці 3 статті, на тестовій частині: найкраща з трьох перевірених моделей, DocQA з ELMo, дає 63,4 EM і 66,3 F1; людина — 86,9 EM і 89,5 F1; розрив 23,2 пункта за F1. Та сама архітектура на SQuAD 1.1 давала 85,8 F1, тобто відставала від людини всього на 5,4. Окрема цифра, яка каже про стан справ найбільше: система, що завжди мовчить, набирає 48,9 F1 на тесті, і наявні моделі ближчі до неї, ніж до людини. Людський рівень тут рахували інакше, ніж 2016 року: збирали в середньому 4,8 відповіді на питання й брали більшість. Автори прямо пояснюють, чому давнє число нижче: у першій роботі оцінювали одну людину, тож людську точність там радше занижено. Це і знімає розбіжність між 77,0/86,8 у статті 2016 року й 82,304/91,221 на лідерборді. Ще один вимір, який рідко згадують: приблизно половина хибних відповідей — і в машин, і в людей — точно збігалася з тим правдоподібним відрізком, який краудворкер лишив як приманку.