C4: веб, відфільтрований шістьма правилами
23 жовтня 2019 року Google випустив C4 — близько 750 ГБ англомовного тексту, зробленого з одного місячного зрізу Common Crawl за квітень 2019 року. Корпус роздавали через TensorFlow Datasets разом зі статтею про моделі T5.
Чому це важливо
Доти відкриті текстові корпуси або були малі, або лишалися сирим дампом. Тут уперше великий веб-корпус вийшов у світ разом із точним списком правил, за якими з нього щось викидали, — і саме ці правила через півтора року вдалося перевірити ззовні.
Шість правил очищення: лишати лише рядки, що закінчуються кінцевим розділовим знаком; викидати сторінку, якщо в ній є бодай одне слово зі «List of Dirty, Naughty, Obscene or Otherwise Bad Words»; викидати рядки зі словом Javascript; викидати сторінки з «lorem ipsum»; викидати сторінки з фігурною дужкою, бо вона буває в коді й не буває в природному тексті; лишати один примірник будь-якого трирічного збігу в три речення. Далі — фільтр мови: лишалися сторінки, визначені як англійські з імовірністю не менш ніж 0,99. Один місячний обхід Common Crawl дає близько 20 ТБ тексту; після цих правил лишилося близько 750 ГБ. Запис свідомо не наводить ані кількості токенів, ані назви ліцензії, ані роздачі на Hugging Face: у першій версії статті цього немає. Число «156 мільярдів токенів» походить із пізнішого стороннього опису корпусу, а не звідси.