LAION-5B: 5,85 мільярда пар, із них третина не англійською
31 березня 2022 року LAION виклала 5,85 мільярда пар «зображення — текст», у чотирнадцять разів більше за LAION-400M. Англійською — 2,3 мільярда пар, ще 2,2 мільярда — понад сотнею інших мов, і близько мільярда — без визначеної мови.
Чому це важливо
Доти відкриті набори такого масштабу існували лише англійською, і мультимодальні моделі за межами англійської не було на чому вчити. Тут уперше половина набору — не англійська. За півроку на підмножині цього набору вийде модель, ваги якої можна запустити вдома.
Набір роздавали з вкладеннями CLIP ViT-L/14, kNN-індексами й оцінками ймовірності водяного знака та небезпечного вмісту для кожного запису. Про ліцензію треба говорити точно, бо тут найлегше помилитися. Під Creative Commons CC-BY 4.0 роздано метадані — parquet-файли з посиланнями й підписами. Самі зображення лишаються під своїм авторським правом; LAION їх не роздає й не має на них прав. Це відмінність, на якій тримаються всі подальші суперечки про набір. Запис не наводить розміру метаданих у гігабайтах: у релізі цього числа немає. Точніший поділ на підмножини — 2,32, 2,26 і 1,27 мільярда — походить не звідси, а з пізнішого стороннього звіту.