Повернутися до часової лінії

Дослідження · 10 квітня 2024 р.

Розміщено за датою сучасного події першоджерела. Точна дата події невідома; нижче наведено підтверджений часовий інтервал.

Стисла пам'ять замість KV-кешу, що росте

10 квітня 2024 року Google описала Infini-attention: локальна увага й довготривала стисла пам'ять в одному блоці трансформера. Модель на 1 мільярд параметрів, донавчена на відрізках у 5 тисяч токенів, знаходила ключ у послідовності на мільйон токенів.

Чому це важливо

Доти довший контекст означав пропорційно більший KV-кеш, тобто пам'ять зростала разом із довжиною і десь неминуче впиралася. Тут стара частина послідовності згортається у матрицю сталого розміру, і довжина перестає бути питанням пам'яті.

Механізм не додає окремих матриць ваг: він повторно використовує вектори Q, K і V того самого шару уваги — запитом дістає зі стислої пам'яті, ключем і значенням її оновлює. Довжина сегмента у дослідах — 2 тисячі токенів. Число 114 стосується саме порівняння: Infini-Transformer має у 114 разів менше параметрів пам'яті (1,6 мільйона проти 183 мільйонів), ніж Memorizing Transformer із векторним KV-сховищем довжиною 65 тисяч на дев'ятому шарі, і водночас дає кращу перплексію. Перевірено на PG19 та Arxiv-math, моделі 1B і 8B. Межі. Стовідсоткове знаходження ключа на мільйоні токенів у таблиці 3 дає варіант Linear + Delta; простий Linear на мільйоні падає до 96/94/100 залежно від того, у якій частині тексту схований ключ. Підсумовування книжок на 500 тисячах токенів (BookSum) — це підсумовування, а не міркування на всю довжину; запис не стверджує, що модель тримає на мільйоні токенів довільне завдання.

Відомості про подію

Дата події
10 квітня 2024 р.
Дата на часовій лінії
Дата первинної публікації
Перевірка
Джерела зібрано автоматично · 21 вересня 2026 р.
Лінії
ID
evt-0531

День подання першої версії препринта. Друга вийшла 9 серпня 2024 року; числа прочитано у першій.

Джерела

Пов’язані події

Записи, що посилаються на цей