CLIP
CLIP навчав спільні представлення зображень і тексту.
Чому це важливо
Ця робота поєднала представлення зображень і тексту без спеціального набору міток для задачі.
Дані з вебу можуть переносити в модель упередження й шум.
Дослідження · 5 січня 2021 р.
CLIP навчав спільні представлення зображень і тексту.
Ця робота поєднала представлення зображень і тексту без спеціального набору міток для задачі.
Дані з вебу можуть переносити в модель упередження й шум.
OpenAI · Опубліковано 5 січня 2021 р.
arXiv · Опубліковано 26 лютого 2021 р.
Текстовий encoder CLIP використовує Transformer; це підтверджує технічна стаття, додана поряд з анонсом.
CLIPОбидва підходи пов’язують текст і зображення: CLIP зіставляє їх, а Muse Image генерує зображення. Пряма залежність моделей не стверджується.
Текстову умову подано через подання, навчене зіставляти текст і зображення.
Пари відбирала сама CLIP: лишалися ті, де косинус між вкладеннями тексту й зображення не менший за 0,3.
LAION-400-MILLION OPEN DATASETЗоровий кодер Flamingo попередньо навчено контрастно «на кшталт CLIP», з дволанковою контрастною втратою зі статті про CLIP.
Flamingo: a Visual Language Model for Few-Shot Learning (arXiv:2204.14198v1)Зоровий кодер LLaVA — попередньо навчений CLIP ViT-L/14, з'єднаний із мовною моделлю однією лінійною проєкцією.
Visual Instruction Tuning (arXiv:2304.08485v1)