Imagen: великий мовний кодер для генерації
23 травня 2022 року Google Research описав Imagen: дифузійна модель, що генерує зображення з тексту, закодованого замороженою мовною моделлю T5-XXL. Без навчання на COCO вона дала FID 7,27. Ні коду, ні публічної демонстрації Google не випустив.
Чому це важливо
Стаття показала, що для генерації зображень з тексту збільшувати мовний кодер, навчений лише на тексті, корисніше, ніж збільшувати саму дифузійну модель. Заразом Google відмовився від відкритого випуску через ризики зловживань.
Разом зі статтею запропоновано DrawBench — набір підказок для порівняння моделей людьми. Рішення не випускати код і демонстрацію стаття пояснює тим, що генеративні методи можна використати для цькування й дезінформації, і питаннями упереджень; TechCrunch 20 липня 2022 року підтвердив, що Google не випустив Imagen через ризики зловживань.