Стала кількість сторінок кеша
20 лютого 2025 року MIT, Шанхайський університет Цзяотун і NVIDIA показали LServe, де розріджену увагу застосовано і на заповненні, і на декодуванні. Заповнення прискорено до 2,9 раза, декодування — в 1,3–2,1 раза проти vLLM.
Чому це важливо
Доти розріджену увагу застосовували до однієї зі стадій. Головне ж тут не прискорення, а спостереження під ним: щоб зберегти роботу на довгому контексті, досить сталої кількості сторінок кеша, і вона не залежить від довжини контексту.
Половину голів уваги переведено у стрімінговий режим, де вони майже нічого не коштують, і зроблено це на обох стадіях одразу. Пропуск обчислень іде блоками, за сторінками кеша. Ключове спостереження статті: щоб утримати здатність працювати з довгим контекстом, потрібна стала кількість сторінок кеша — незалежно від того, наскільки контекст довгий. Звідси ієрархічний добір сторінок під кожен токен запиту, причому результат добору перевикористовують між токенами, що знижує накладні витрати самого добору вчетверо. Статична й динамічна розрідженість виявилися ортогональними, тож їхні прискорення перемножуються, а не заміщають одне одного. Чого запис не стверджує. Числа 2,9 та 1,3–2,1 — це порівняння з vLLM, а не з теоретичною межею заліза, і стаття називає перше з них як «до», тобто верхню межу.