«Стохастичні папуги»: чи може мовна модель бути завеликою
У березні 2021 року в матеріалах конференції ACM FAccT '21 вийшла стаття Емілі Бендер, Тімніт Гебру, Анджеліни Макміллан-Мейджор і четвертої авторки під псевдонімом. Чотирнадцять сторінок питають, наскільки великою модель бути завелика, і називають чотири напрями ризику: екологічна й фінансова ціна навчання, непідйомні для розуміння навчальні дані, приписування моделі розуміння, якого в неї немає, і шкода від тексту, що вона породжує.
Чому це важливо
Це перший в атласі текст, який ставить питання не про те, що модель уміє, а про те, чого коштує її розмір — і ставить його до того, як великі мовні моделі дійшли до споживача. Звідси в мову галузі ввійшло слово, яким описують систему, що складає послідовності форм без звернення до значення.
Означення з розділу 6: мовна модель — це система для безсистемного зшивання послідовностей мовних форм, які вона бачила у своїх величезних навчальних даних, за ймовірнісними відомостями про те, як ці форми поєднуються, але без жодного звернення до значення: стохастичний папуга. Розділи статті: екологічна й фінансова ціна; непідйомні навчальні дані; стохастичні папуги. Рекомендації з анотації: спершу зважувати екологічну й фінансову ціну; вкладати ресурси в курування й ретельне документування наборів даних замість поглинання всього, що є в мережі; перед розробкою оцінювати, як задум лягає в цілі дослідження й чи підтримує цінності причетних; і заохочувати напрями, що не зводяться до дедалі більших моделей. Звідти ж поняття «борг документації». Авторки підписані так: Емілі Бендер і Анджеліна Макміллан-Мейджор — Вашингтонський університет, Тімніт Гебру — Black in AI, четверта — «Шмаргарет Шмітчелл» з афіліацією «The Aether», тобто під псевдонімом. Запис не називає, хто за ним стоїть: стаття цього не каже. Виноска на першій сторінці позначає спільне перше авторство. Сторінки 610–623, DOI 10.1145/3442188.3445922, ліцензія Creative Commons Attribution 4.0.