QLoRA
Метод дозволив донавчати модель на 65 мільярдів параметрів на одній відеокарті, зберігаючи ваги в чотирьох бітах і змінюючи лише невеликі додаткові матриці.
Чому це важливо
Донавчання великої моделі перестало вимагати кластера — і відкриті моделі стали придатними для будь-кого з ігровою відеокартою.
Дві ідеї разом: квантування базових ваг до чотирьох бітів і навчання лише низькорангових доповнень. Базова модель при цьому не змінюється, тож пам'ять іде на неї один раз. Утрати якості виявилися незначними. Наслідок екосистемний: спільнота донавчених варіантів відкритих моделей, що виникла після LLaMA, стала можливою саме технічно.