LAION-400M: пари «зображення — підпис» у відкритому доступі
20 серпня 2021 року неприбуткова мережа LAION виклала 400 мільйонів англомовних пар «зображення — текст», витягнутих із Common Crawl. Пари відбирала модель CLIP: лишалися ті, де косинусна схожість тексту й зображення була не нижчою за 0,3.
Чому це важливо
Доти набір такого розміру був лише в OpenAI — той самий, на якому вчили CLIP і DALL·E, і якого ніхто, крім OpenAI, не бачив. Після цього дня будь-хто міг узяти зіставний матеріал; уся подальша відкрита генерація зображень стоїть на цьому.
Унікальних зразків 413 мільйонів. Роздавали не зображення, а метадані: 32 parquet-файли приблизно по гігабайту, разом близько 50 ГБ, із полями URL, TEXT, LICENSE, NSFW, similarity, WIDTH, HEIGHT. Самі зображення кожен завантажує сам. Поріг 0,3 добирали вручну — у релізі сказано, що його визначили людськими оцінками як прийнятну евристику відповідності підпису зображенню. Окремо варто зацитувати, що сказано про фільтрацію змісту: «Our filtering protocol only removed NSFW images detected as illegal» — тобто відсіювали лише те, що детектор визнав незаконним, а решта позначеного лишалася в наборі. Через два роки саме межі цієї фільтрації стануть предметом окремої перевірки.