vLLM: пам'ять уваги починають гортати сторінками
19 червня 2023 року вийшов перший випуск vLLM — рушія для обслуговування мовних моделей. У його основі PagedAttention: керування кешем ключів і значень за зразком сторінкової віртуальної пам'яті операційних систем.
Чому це важливо
Обслуговування моделі перестало впиратися в марно зайняту пам'ять. Заявлений виграш — у два-чотири рази більша пропускна здатність за тієї самої затримки, і це прямо здешевило те, скільки людей одна модель здатна обслужити.
Стаття «Efficient Memory Management for Large Language Model Serving with PagedAttention» подана 12 вересня 2023 року, майданчик SOSP 2023, перший автор Усок Квон, усього дев'ятеро авторів. За нею PagedAttention дає близьке до нуля марнування пам'яті кешу й гнучке спільне використання кешу між запитами; виграш у два-чотири рази заявлено проти FasterTransformer і Orca. Порядок подій тут зворотний до звичного для наукових записів: пакет став доступним 19 червня 2023 року, за три місяці до статті, а репозиторій створено ще 9 лютого 2023 року. Тому запис стоїть на даті доступності, а не публікації — стаття описує те, що вже працювало.