Повернутися до часової лінії

Дослідження · 21 квітня 2021 р.

Розміщено за датою сучасного події першоджерела. Точна дата події невідома; нижче наведено підтверджений часовий інтервал.

1287 мегават-годин на GPT-3

21 квітня 2021 року Google і Каліфорнійський університет у Берклі опублікували енергетичний облік п'яти великих моделей. Навчання GPT-3 — 10 000 прискорювачів V100 упродовж 14,8 доби, 3,14·10^23 операції — коштувало 1287 МВт·год і 552,1 тонни CO2-еквівалента. Це 0,01055 % річного споживання енергії Google за 2019 рік.

Чому це важливо

Доти єдиним числом про вуглецевий слід великої моделі була оцінка ззовні. Тут поруч із сумою названо те, від чого вона залежить: коефіцієнт ефективності конкретного дата-центру й вуглецева інтенсивність конкретної мережі в конкретний місяць. Величину стало видно не як властивість моделі, а як властивість місця й часу, у яких її навчали.

Для прогону GPT-3 коефіцієнт ефективності дата-центру становив 1,10, а вуглецева інтенсивність — 0,429 кг на кіловат-годину; прогін ішов у 2020 році в дата-центрі Microsoft. Таблиця порівнює п'ять моделей: T5, Meena, GShard, Switch Transformer і GPT-3. Найбільший слід у GPT-3, найменший — 3,2 тонни. Абстракт додає два висновки: розріджено активовані мережі споживають менш ніж десяту частину енергії щільних тієї самої точності, а вибір мережі, дата-центру й прискорювача разом рухає слід у 100–1000 разів. Чого запис не стверджує. Рамки «4M» у цій статті немає: рядки 4M, Mechanization і Map трапляються в ній нуль разів, а сама мнемоніка з'явилася в пізнішій роботі тих самих авторів. Числа GPT-3 — реконструкція за даними, які OpenAI повідомила авторам, а не показання лічильника.

Відомості про подію

Дата події
21 квітня 2021 р.
Дата на часовій лінії
Дата первинної публікації
Перевірка
Джерела зібрано автоматично · 22 вересня 2026 р.
Лінії
ID
evt-0579

День подання першої версії. Того тижня arXiv прийняв ще дві; числа прочитано в першій.

Джерела

Пов’язані події

Записи, що посилаються на цей