Chinchilla: навчання, оптимальне за обчисленнями
29 березня 2022 року Джордан Гоффманн і колеги з DeepMind виклали результат навчання понад 400 мовних моделей від 70 млн до понад 16 млрд параметрів на 5–500 млрд токенів: за оптимального використання обчислень розмір моделі й кількість токенів треба масштабувати порівну. Chinchilla на 70 млрд параметрів, навчена на 1,4 трлн токенів за бюджетом Gopher (учетверо більше даних, ніж у Gopher на 280 млрд), перевершила Gopher, GPT-3, Jurassic-1 і Megatron-Turing NLG і досягла 67,5 % на MMLU — поліпшення понад 7 % щодо Gopher.
Чому це важливо
Правило, за яким вибирали розмір великих моделей, переписано: за Капланом і співавторами (2020) при 10-кратному бюджеті модель мала рости в 5,5 раза, а токени лише в 1,8, і більшість великих моделей навчено приблизно на 300 млрд токенів. За цією статтею вони суттєво недонавчені. LLaMA 2023 року відштовхується від цієї рекомендації.
Кожне подвоєння розміру моделі має супроводжуватися подвоєнням кількості навчальних токенів. Менша за Gopher, Chinchilla також потребує менше обчислень для донавчання й виведення. Блок авторів належностей не друкує; адреси листування — на deepmind.com, картка моделі в додатку називає розробником DeepMind.