Низькорангова адаптація (LoRA)
17 червня 2021 року Едвард Ху і семеро співавторів з Microsoft виклали LoRA: ваги попередньо навченої моделі заморожуються, а в кожен шар трансформера вводяться навчувані матриці низькорангового розкладу. Для GPT-3 175B перша версія повідомляє в 10 000 разів менше навчуваних параметрів і втричі менші вимоги до обчислювального обладнання, ніж повне донавчання, за якості на рівні або вищій, і контрольну точку, що зменшується з 350 ГБ до 35 МБ.
Чому це важливо
Пристосування дуже великої моделі до задачі перестало означати зберігання її повної копії на кожну задачу: пристосована частина важить мегабайти й підміняється на машині, що тримає заморожені ваги, а оскільки низькоранговий добуток можна злити назад у ваги, виведення не сповільнюється. QLoRA 2023 року — це LoRA, застосована до моделі, квантованої до 4 біт.
У тілі першої версії для GPT-3: використання відеопам'яті під час навчання падає з 1,2 ТБ до 350 ГБ, а за рангу r = 4 контрольна точка зменшується приблизно в 10 000 разів, з 350 ГБ до 35 МБ; навчання на 25 % швидше. Резюме першої версії каже «the computation hardware requirement by 3 times»; друга версія 16 жовтня 2021 року міняє це на «the GPU memory requirement by 3 times». Запис бере перше формулювання.