Кеш уваги у два біти
25 січня 2025 року Tsinghua й Huawei показали RotateKV — стиснення кеша ключів і значень до двох бітів через обертання простору активацій. Пікова пам'ять кеша впала у 3,97 раза, а перплексія на WikiText-2 для LLaMA-2-13B погіршилася менш ніж на 0,3.
Чому це важливо
Зі зростанням довжини контексту й розміру пакета вузьким місцем стає не розмір моделі, а кеш уваги. Робота показала, що його можна тримати у двох бітах без помітної втрати якості — тобто ту саму модель на тому самому залізі можна обслуговувати для вп'ятеро більшої черги.
Прийом спирається на обертання простору активацій, але з двома уточненнями: обертання підбирають під конкретні канали з викидами через їх переупорядкування, і окремо захищають так звані стоки уваги, знаходячи їх за масивними активаціями. Числа першої версії: менш ніж 0,3 пункту деградації перплексії на WikiText-2 із LLaMA-2-13B при двох бітах; менш ніж 1,7 відсотка втрати на GSM8K; зменшення пікової пам'яті кеша у 3,97 раза; підтримка у 5,75 раза більших пакетів; прискорення декодування у 2,32 раза. Чого запис не стверджує. Виміри стосуються моделей сімейства LLaMA-2 і названих тестів, а не довільної моделі. Стиснення торкається кеша, а не ваг: це різні частини пам'яті й різні прийоми.