Обхід вебу стає доступним усім
23 січня 2012 року Common Crawl Foundation оголосив, що його архів обходу вебу — п'ять мільярдів сторінок — розміщено в Amazon Public Data Sets. Зберігання оплачує Amazon, користувач платить лише за власні обчислення.
Чому це важливо
Доти повний зріз вебу мав той, хто сам його обходив, тобто пошукова компанія. Відтепер його мав будь-хто з рахунком у хмарі. Майже кожен великий текстовий корпус наступного десятиліття — і майже кожна суперечка про те, з чого зроблено моделі, — починається в цьому архіві.
Фонд заснував 2007 року Ґіл Ельбаз; дані збирають із 2008-го. Станом на 2026 рік обхід виходить приблизно раз на місяць і містить понад два мільярди сторінок за раз, а весь архів перевищує 10 пебібайтів. Що саме зробила ця дата: не появу корпусу, а зникнення вартості доступу до нього. До розміщення в Public Data Sets отримати п'ять мільярдів сторінок означало завантажити їх до себе. Запис не називає обсягу в терабайтах, кількості архівних файлів і жодного інструмента обробки: оголошення фонду цих чисел не містить. Про частку в навчальних даних теж треба обережно. У таблиці 2.2 статті про GPT-3 відфільтрований Common Crawl дає 410 мільярдів токенів із 499 мільярдів зібраного набору, але вага під час навчання — 60 %, і автори окремо кажуть, що ваги навмисно не пропорційні розмірам.