Закони масштабування
Дослідження виміряло зв’язок втрат із масштабом.
Чому це важливо
Ця робота зробила масштаб вимірюваною змінною проєктування мовних моделей.
Наведені залежності є емпіричними наближеннями в дослідженому діапазоні.
Дослідження · 23 січня 2020 р.
Дослідження виміряло зв’язок втрат із масштабом.
Ця робота зробила масштаб вимірюваною змінною проєктування мовних моделей.
Наведені залежності є емпіричними наближеннями в дослідженому діапазоні.
arXiv · Опубліковано 23 січня 2020 р.
Дослідження вимірювало моделі тієї самої архітектурної родини.
Обидва записи стосуються обчислювальних ресурсів. Закономірності навчання не є доказом походження архітектури чипа для інференсу.
Обчислення такого обсягу зробили можливими досліди з масштабування.
Розмір моделі обрано за законами масштабування, опублікованими того ж року.
Language Models are Few-Shot LearnersЯкість зростає з обчисленнями під час відповіді, а не лише під час навчання.
Закони масштабування описали, як якість росте плавно з обчисленням; цей набір шукав завдання, де вона росте не плавно, і назвав крихкі метрики однією з причин таких стрибків.
Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language modelsЗакон масштабування каже, скільки обчислень варто витратити; цей ряд каже, скільки їх витрачали насправді і як швидко це росло.
Compute Trends Across Three Eras of Machine Learning (arXiv:2202.05924v1)Каплан і співавтори радили при 10-кратному бюджеті збільшувати модель у 5,5 раза, а токени лише в 1,8; ця стаття знаходить, що розмір моделі й кількість токенів треба масштабувати в рівних пропорціях.
Training Compute-Optimal Large Language Models