Flamingo: зір і мова з кількох прикладів
29 квітня 2022 року Жан-Батіст Алайрак і співавтори з DeepMind описали Flamingo — моделі, що з'єднують заморожений зоровий кодер і заморожену мовну модель та приймають вперемішку текст, зображення й відео. Найбільша має 80 млрд параметрів і на 6 із 16 завдань перевершила донавчені моделі, маючи лише 32 приклади.
Чому це важливо
Одна модель почала розв'язувати нові завдання про зображення з кількох прикладів у запиті, як GPT-3 з текстом, замість окремого донавчання під кожен набір. Від неї йде лінія великих мовних моделей, що бачать.
Між кодером і мовною моделлю стоять Perceiver Resampler і нові шари перехресної уваги з вентилями; навчені лише вони. Дані — зокрема M3W, текст і зображення з HTML близько 43 млн вебсторінок у їхньому порядку. Серед завдань є відкриті: відповіді на запитання про зображення, підписи, діалог.