Що насправді лежить у корпусі, на якому вчили T5
18 квітня 2021 року вийшов перший опис корпусу C4 — 156 мільярдів токенів, 365 мільйонів документів, — на якому навчали моделі T5. Фільтр «поганих слів» викидав афроамериканську англійську з часткою 42 % проти 6,2 % для білої, а в усіх п'яти перевірених тестових наборах знайшлися дослівні збіги.
Чому це важливо
Доти великі текстові корпуси віддавали майже без опису: розмір, спосіб збирання, і все. Ця робота показала, що фільтри, які виглядають технічними, вибирають, чия мова потрапить у модель, і що закритий тестовий набір може лежати в претренінгу. Відтоді питання «з чого це зроблено» стало питанням із числами, а не риторичним.
Три версії корпусу: без очищення (1,1 мільярда документів, 2,3 ТБ), без списку заборонених слів (395 мільйонів) і власне C4.EN — 365 мільйонів документів, 305 ГБ, 156 мільярдів токенів. Найчастіше джерело — patents.google.com, де помітна частка тексту машинно перекладена або розпізнана з зображення. Головний вимір — про фільтр. Список «поганих слів» мав викидати ворожу й непристойну мову. Виміряно, що він викидає документи афроамериканською англійською з часткою 42 % і іспаномовно-забарвленою — 32 %, тоді як білу англійську та решту — 6,2 % і 7,2 %. У самому C4.EN 97,8 % документів віднесено до білої англійської, до афроамериканської — 0,07 %. Про забруднення тестами треба говорити точно, бо тут найлегше перебільшити. Автори перевірили п'ять наборів і підсумували себе так: усі п'ять мають якесь забруднення, але в більшості воно невелике. Частки: приблизно 1 % цільових резюме CNN/Daily Mail, 4,6 % і 3,3 % прикладів LAMA T-REx і Google-RE дослівно в корпусі, 2,4 % тестових питань BoolQ і 14,4 % тестових прикладів CoLA за входом. SQuAD, MNLI, SST-2 і WNLI у цій роботі не перевіряли й не згадують жодного разу. Разом зі статтею випустили пошуковий індекс корпусу, щоб перевірку могли повторити інші. Перша версія препринта має коротшу назву, ніж версія, опублікована на EMNLP.