1287 мегават-годин на GPT-3
21 квітня 2021 року Google і Каліфорнійський університет у Берклі опублікували енергетичний облік п'яти великих моделей. Навчання GPT-3 — 10 000 прискорювачів V100 упродовж 14,8 доби, 3,14·10^23 операції — коштувало 1287 МВт·год і 552,1 тонни CO2-еквівалента. Це 0,01055 % річного споживання енергії Google за 2019 рік.
Чому це важливо
Доти єдиним числом про вуглецевий слід великої моделі була оцінка ззовні. Тут поруч із сумою названо те, від чого вона залежить: коефіцієнт ефективності конкретного дата-центру й вуглецева інтенсивність конкретної мережі в конкретний місяць. Величину стало видно не як властивість моделі, а як властивість місця й часу, у яких її навчали.
Для прогону GPT-3 коефіцієнт ефективності дата-центру становив 1,10, а вуглецева інтенсивність — 0,429 кг на кіловат-годину; прогін ішов у 2020 році в дата-центрі Microsoft. Таблиця порівнює п'ять моделей: T5, Meena, GShard, Switch Transformer і GPT-3. Найбільший слід у GPT-3, найменший — 3,2 тонни. Абстракт додає два висновки: розріджено активовані мережі споживають менш ніж десяту частину енергії щільних тієї самої точності, а вибір мережі, дата-центру й прискорювача разом рухає слід у 100–1000 разів. Чого запис не стверджує. Рамки «4M» у цій статті немає: рядки 4M, Mechanization і Map трапляються в ній нуль разів, а сама мнемоніка з'явилася в пізнішій роботі тих самих авторів. Числа GPT-3 — реконструкція за даними, які OpenAI повідомила авторам, а не показання лічильника.