Повернутися до часової лінії

Дослідження · 17 квітня 2023 р.

LLaVA: відкритий асистент, що бачить

17 квітня 2023 року Хаотянь Лю й співавтори з Вісконсинського університету, Microsoft Research і Колумбійського університету описали LLaVA: зоровий кодер CLIP, з'єднаний із мовною моделлю LLaMA однією лінійною проєкцією й донавчений на 158 тисячах інструкцій, які згенерувала текстова GPT-4.

Чому це важливо

Розмову про зображення вдалося навчити без людської розмітки інструкцій і відкрити разом із даними й кодом. За місяць після оголошення GPT-4 з'явилася відкрита модель, що відтворює частину її поведінки з картинками.

Інструкції — 58 тисяч розмов, 23 тисячі детальних описів і 77 тисяч завдань на міркування; вирівнювання перед тим — на 595 тисячах пар із CC3M. На синтетичному наборі LLaVA набирає 85,1 % відносно GPT-4, а на Science QA разом із GPT-4 — 92,53 %. Перша версія називає мовною моделлю LLaMA; Vicuna в ній лише серед споріднених робіт.

Відомості про подію

Дата події
17 квітня 2023 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 25 вересня 2026 р.
Лінії
ID
evt-0777

День подання першої версії препринта; числа прочитано в ній.

Джерела

Пов’язані події