Стисла пам'ять замість KV-кешу, що росте
10 квітня 2024 року Google описала Infini-attention: локальна увага й довготривала стисла пам'ять в одному блоці трансформера. Модель на 1 мільярд параметрів, донавчена на відрізках у 5 тисяч токенів, знаходила ключ у послідовності на мільйон токенів.
Чому це важливо
Доти довший контекст означав пропорційно більший KV-кеш, тобто пам'ять зростала разом із довжиною і десь неминуче впиралася. Тут стара частина послідовності згортається у матрицю сталого розміру, і довжина перестає бути питанням пам'яті.
Механізм не додає окремих матриць ваг: він повторно використовує вектори Q, K і V того самого шару уваги — запитом дістає зі стислої пам'яті, ключем і значенням її оновлює. Довжина сегмента у дослідах — 2 тисячі токенів. Число 114 стосується саме порівняння: Infini-Transformer має у 114 разів менше параметрів пам'яті (1,6 мільйона проти 183 мільйонів), ніж Memorizing Transformer із векторним KV-сховищем довжиною 65 тисяч на дев'ятому шарі, і водночас дає кращу перплексію. Перевірено на PG19 та Arxiv-math, моделі 1B і 8B. Межі. Стовідсоткове знаходження ключа на мільйоні токенів у таблиці 3 дає варіант Linear + Delta; простий Linear на мільйоні падає до 96/94/100 залежно від того, у якій частині тексту схований ключ. Підсумовування книжок на 500 тисячах токенів (BookSum) — це підсумовування, а не міркування на всю довжину; запис не стверджує, що модель тримає на мільйоні токенів довільне завдання.