Повернутися до часової лінії

Дослідження · 20 лютого 2025 р.

Розміщено за датою сучасного події першоджерела. Точна дата події невідома; нижче наведено підтверджений часовий інтервал.

Стала кількість сторінок кеша

20 лютого 2025 року MIT, Шанхайський університет Цзяотун і NVIDIA показали LServe, де розріджену увагу застосовано і на заповненні, і на декодуванні. Заповнення прискорено до 2,9 раза, декодування — в 1,3–2,1 раза проти vLLM.

Чому це важливо

Доти розріджену увагу застосовували до однієї зі стадій. Головне ж тут не прискорення, а спостереження під ним: щоб зберегти роботу на довгому контексті, досить сталої кількості сторінок кеша, і вона не залежить від довжини контексту.

Половину голів уваги переведено у стрімінговий режим, де вони майже нічого не коштують, і зроблено це на обох стадіях одразу. Пропуск обчислень іде блоками, за сторінками кеша. Ключове спостереження статті: щоб утримати здатність працювати з довгим контекстом, потрібна стала кількість сторінок кеша — незалежно від того, наскільки контекст довгий. Звідси ієрархічний добір сторінок під кожен токен запиту, причому результат добору перевикористовують між токенами, що знижує накладні витрати самого добору вчетверо. Статична й динамічна розрідженість виявилися ортогональними, тож їхні прискорення перемножуються, а не заміщають одне одного. Чого запис не стверджує. Числа 2,9 та 1,3–2,1 — це порівняння з vLLM, а не з теоретичною межею заліза, і стаття називає перше з них як «до», тобто верхню межу.

Відомості про подію

Дата події
20 лютого 2025 р.
Дата на часовій лінії
Дата первинної публікації
Перевірка
Джерела зібрано автоматично · 22 вересня 2026 р.
Лінії
ID
evt-0572

День подання першої версії препринта. Пізніше arXiv додав другу; числа прочитано у першій.

Джерела

Пов’язані події

Записи, що посилаються на цей