Повернутися до часової лінії

Дослідження · 29 квітня 2022 р.

Flamingo: зір і мова з кількох прикладів

29 квітня 2022 року Жан-Батіст Алайрак і співавтори з DeepMind описали Flamingo — моделі, що з'єднують заморожений зоровий кодер і заморожену мовну модель та приймають вперемішку текст, зображення й відео. Найбільша має 80 млрд параметрів і на 6 із 16 завдань перевершила донавчені моделі, маючи лише 32 приклади.

Чому це важливо

Одна модель почала розв'язувати нові завдання про зображення з кількох прикладів у запиті, як GPT-3 з текстом, замість окремого донавчання під кожен набір. Від неї йде лінія великих мовних моделей, що бачать.

Між кодером і мовною моделлю стоять Perceiver Resampler і нові шари перехресної уваги з вентилями; навчені лише вони. Дані — зокрема M3W, текст і зображення з HTML близько 43 млн вебсторінок у їхньому порядку. Серед завдань є відкриті: відповіді на запитання про зображення, підписи, діалог.

Відомості про подію

Дата події
29 квітня 2022 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 25 вересня 2026 р.
ID
evt-0774

День подання першої версії препринта; у шапці PDF стоїть 28-04-2022. Числа прочитано в першій версії.

Джерела

Пов’язані події

Записи, що посилаються на цей