Повернутися до часової лінії

Доступність · 23 жовтня 2019 р.

Розміщено за датою сучасного події першоджерела. Точна дата події невідома; нижче наведено підтверджений часовий інтервал.

C4: веб, відфільтрований шістьма правилами

23 жовтня 2019 року Google випустив C4 — близько 750 ГБ англомовного тексту, зробленого з одного місячного зрізу Common Crawl за квітень 2019 року. Корпус роздавали через TensorFlow Datasets разом зі статтею про моделі T5.

Чому це важливо

Доти відкриті текстові корпуси або були малі, або лишалися сирим дампом. Тут уперше великий веб-корпус вийшов у світ разом із точним списком правил, за якими з нього щось викидали, — і саме ці правила через півтора року вдалося перевірити ззовні.

Шість правил очищення: лишати лише рядки, що закінчуються кінцевим розділовим знаком; викидати сторінку, якщо в ній є бодай одне слово зі «List of Dirty, Naughty, Obscene or Otherwise Bad Words»; викидати рядки зі словом Javascript; викидати сторінки з «lorem ipsum»; викидати сторінки з фігурною дужкою, бо вона буває в коді й не буває в природному тексті; лишати один примірник будь-якого трирічного збігу в три речення. Далі — фільтр мови: лишалися сторінки, визначені як англійські з імовірністю не менш ніж 0,99. Один місячний обхід Common Crawl дає близько 20 ТБ тексту; після цих правил лишилося близько 750 ГБ. Запис свідомо не наводить ані кількості токенів, ані назви ліцензії, ані роздачі на Hugging Face: у першій версії статті цього немає. Число «156 мільярдів токенів» походить із пізнішого стороннього опису корпусу, а не звідси.

Відомості про подію

Дата події
23 жовтня 2019 р.
Дата на часовій лінії
Дата первинної публікації
Перевірка
Джерела зібрано автоматично · 21 вересня 2026 р.
Лінії
ID
evt-0518

День першої версії препринта за історією подань arXiv. Усі числа запису прочитано саме у версії 1, а не на сторінці анотації, яка показує версію 2023 року.

Джерела

Пов’язані події

Записи, що посилаються на цей