Повернутися до часової лінії

Дослідження · 17 червня 2021 р.

Низькорангова адаптація (LoRA)

17 червня 2021 року Едвард Ху і семеро співавторів з Microsoft виклали LoRA: ваги попередньо навченої моделі заморожуються, а в кожен шар трансформера вводяться навчувані матриці низькорангового розкладу. Для GPT-3 175B перша версія повідомляє в 10 000 разів менше навчуваних параметрів і втричі менші вимоги до обчислювального обладнання, ніж повне донавчання, за якості на рівні або вищій, і контрольну точку, що зменшується з 350 ГБ до 35 МБ.

Чому це важливо

Пристосування дуже великої моделі до задачі перестало означати зберігання її повної копії на кожну задачу: пристосована частина важить мегабайти й підміняється на машині, що тримає заморожені ваги, а оскільки низькоранговий добуток можна злити назад у ваги, виведення не сповільнюється. QLoRA 2023 року — це LoRA, застосована до моделі, квантованої до 4 біт.

У тілі першої версії для GPT-3: використання відеопам'яті під час навчання падає з 1,2 ТБ до 350 ГБ, а за рангу r = 4 контрольна точка зменшується приблизно в 10 000 разів, з 350 ГБ до 35 МБ; навчання на 25 % швидше. Резюме першої версії каже «the computation hardware requirement by 3 times»; друга версія 16 жовтня 2021 року міняє це на «the GPU memory requirement by 3 times». Запис бере перше формулювання.

Відомості про подію

Дата події
17 червня 2021 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 24 вересня 2026 р.
Лінії
ID
evt-0670

Перша з двох версій препринта arXiv:2106.09685, 17 червня 2021 року; друга — 16 жовтня 2021. Формулювання й числа — з першої.

Джерела

Пов’язані події