LLaVA: відкритий асистент, що бачить
17 квітня 2023 року Хаотянь Лю й співавтори з Вісконсинського університету, Microsoft Research і Колумбійського університету описали LLaVA: зоровий кодер CLIP, з'єднаний із мовною моделлю LLaMA однією лінійною проєкцією й донавчений на 158 тисячах інструкцій, які згенерувала текстова GPT-4.
Чому це важливо
Розмову про зображення вдалося навчити без людської розмітки інструкцій і відкрити разом із даними й кодом. За місяць після оголошення GPT-4 з'явилася відкрита модель, що відтворює частину її поведінки з картинками.
Інструкції — 58 тисяч розмов, 23 тисячі детальних описів і 77 тисяч завдань на міркування; вирівнювання перед тим — на 595 тисячах пар із CC3M. На синтетичному наборі LLaVA набирає 85,1 % відносно GPT-4, а на Science QA разом із GPT-4 — 92,53 %. Перша версія називає мовною моделлю LLaMA; Vicuna в ній лише серед споріднених робіт.