SQuAD: сто тисяч питань до абзаців Вікіпедії
16 червня 2016 року Стенфорд опублікував набір із 107 785 питань, складених краудворкерами до 536 статей Вікіпедії, де відповіддю є відрізок самого абзацу. Власна модель авторів дала 51,0 F1, людина на тесті — 86,8.
Чому це важливо
Доти набори на розуміння тексту були або малі, або зроблені шаблоном, і на них не можна було навчати. Сто тисяч розмічених питань із відповіддю-відрізком зробили розуміння прочитаного задачею, яку вчать, а не задачею, яку показують, — і задали формат, у якому наступні чотири роки міряли мовні моделі.
Абзаци відібрано так: із десяти тисяч найвагоміших англомовних статей Вікіпедії за внутрішнім PageRank узято випадкові 536, з них — 23 215 абзаців довших за 500 знаків. Краудворкерам платили дев'ять доларів за годину. Оцінювання — двома мірами: точний збіг рядка (EM) і перекриття на рівні токенів (F1). Число, що показує складність на момент виходу: власна логістична регресія авторів дала 40,0 EM і 51,0 F1 проти 20 % у ковзного вікна. За чотири місяці нейромережі дійшли до 70,3 F1. Про людський рівень тут є розбіжність, і вона реальна. Стаття, розділ 6.2: «77,0 % за точним збігом і 86,8 % за F1» — брали другу відповідь на питання як передбачення людини. Лідерборд SQuAD показував інше число, 82,304 EM і 91,221 F1. Обидва справжні, рахували їх по-різному, і причину назвали самі автори у статті про SQuAD 2.0: у 2016 році оцінювали одну людину, тож людський рівень радше занижено. Лідерборд же дає й дату, коли машина перейшла людську позначку. Станом на 15 січня 2018 року нагорі стояли r-net+ від Microsoft Research Asia (82,650 EM, 3 січня) і SLQA+ від Alibaba (82,440 EM, 5 січня) проти людських 82,304. Але за F1 жодна з них людину не перевершила: 88,493 і 88,607 проти 91,221. Отже «машина перевершила людину на SQuAD» вірне рівно для однієї з двох мір. Запис не стверджує, що SQuAD запровадив прихований тестовий сервер: у статті цього немає, там звичайна відкладена десята частина. Закритий лідерборд як заявлену рису ввів GLUE двома роками пізніше.