Поворотні позиційні вкладення (RoPE)
20 квітня 2021 року Цзяньлінь Су, Юй Лу, Шенфен Пань, Бо Вень і Юньфен Лю із Zhuiyi Technology (Шеньчжень) виклали RoFormer: позиція токена кодується матрицею обертання, що повертає вектор на кут, залежний від позиції, і самоувага природно дістає залежність від відносної відстані. Експерименти першої версії — лише китайські: після попереднього навчання на близько 34 ГБ китайських текстів на задачі зіставлення судових справ CAIL2019-SCM RoFormer досяг 69,79 % на тесті при довжині 1024 проти 68,10 % у WoBERT при 512.
Чому це важливо
Позиція стала властивістю самого добутку уваги, а не вектором, доданим до входу, і, як показує стаття, це сумісне з лінійною увагою. LLaMA 2023 року прибрала абсолютні позиційні вкладення й узяла поворотні, запроваджені Su et al. (2021); їх же називає картка моделі Falcon.
Перша версія каже, що перевірка на англійських даних ще триває. Порівняння на WMT 2014 англійська–німецька, яке зазвичай наводять разом з RoPE, — 27,5 BLEU проти 27,3 у базового трансформера, — з'являється лише в другій версії 9 жовтня 2021 року й не є результатом цього запису. CAIL2019-SCM містить 8964 трійки справ, опублікованих Верховним народним судом Китаю; точність на тесті при довжині 512 — 67,77 % у BERT, 68,10 % у WoBERT і 68,29 % у RoFormer.