Повернутися до часової лінії

Дослідження · жовтень 2020 р.

Трансформер для зображень

Зображення поділили на клаптики і подали трансформеру як послідовність слів — і за великих даних він перевершив згорткові мережі.

Чому це важливо

Дві галузі, що вісім років розвивалися окремо, зійшлися на одній архітектурі — передумова мультимодальних моделей.

Згортка вбудовує в мережу припущення про локальність і незмінність до зсуву, що дуже допомагає на малих даних. Стаття показала, що за достатнього обсягу модель вивчає це сама, а вбудоване припущення стає обмеженням. Наслідок ширший за зір: одна архітектура для тексту, зображень і звуку зробила можливими CLIP, DALL-E і все, що працює з кількома модальностями одночасно.

Відомості про подію

Дата події
жовтень 2020 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 17 вересня 2026 р.
Лінії
ID
evt-0241

Препринт від 22 жовтня 2020 року; доповідь на ICLR 2021.

Джерела

Пов’язані події

Записи, що посилаються на цей