Повернутися до часової лінії

Дослідження · 23 травня 2022 р.

Imagen: великий мовний кодер для генерації

23 травня 2022 року Google Research описав Imagen: дифузійна модель, що генерує зображення з тексту, закодованого замороженою мовною моделлю T5-XXL. Без навчання на COCO вона дала FID 7,27. Ні коду, ні публічної демонстрації Google не випустив.

Чому це важливо

Стаття показала, що для генерації зображень з тексту збільшувати мовний кодер, навчений лише на тексті, корисніше, ніж збільшувати саму дифузійну модель. Заразом Google відмовився від відкритого випуску через ризики зловживань.

Разом зі статтею запропоновано DrawBench — набір підказок для порівняння моделей людьми. Рішення не випускати код і демонстрацію стаття пояснює тим, що генеративні методи можна використати для цькування й дезінформації, і питаннями упереджень; TechCrunch 20 липня 2022 року підтвердив, що Google не випустив Imagen через ризики зловживань.

Відомості про подію

Дата події
23 травня 2022 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 25 вересня 2026 р.
Лінії
ID
evt-0763

День подання першої версії препринта; числа прочитано в ній.

Джерела

Пов’язані події