Трансформер для зображень
Зображення поділили на клаптики і подали трансформеру як послідовність слів — і за великих даних він перевершив згорткові мережі.
Чому це важливо
Дві галузі, що вісім років розвивалися окремо, зійшлися на одній архітектурі — передумова мультимодальних моделей.
Згортка вбудовує в мережу припущення про локальність і незмінність до зсуву, що дуже допомагає на малих даних. Стаття показала, що за достатнього обсягу модель вивчає це сама, а вбудоване припущення стає обмеженням. Наслідок ширший за зір: одна архітектура для тексту, зображень і звуку зробила можливими CLIP, DALL-E і все, що працює з кількома модальностями одночасно.