MMLU: 57 предметів, які модель не вчила
7 вересня 2020 року вийшов тест із 15 908 питань із чотирма варіантами відповіді в 57 дисциплінах — від елементарної математики до професійної медицини й права, — який модель має складати без донавчання. GPT-3 на 175 мільярдів параметрів дала 43,9 % при 25 % у випадкового вгадування.
Чому це важливо
Доти мовну модель міряли на задачах, під які її донавчали, і бал казав, наскільки добре пройшло донавчання. Набір із питань професійних іспитів, яких модель не бачила й під які її не готували, переніс питання з мовних умінь на те, що модель узагалі знає, — і задав шкалу, якою галузь користувалася наступні п'ять років.
15 908 питань зібрали студенти й аспіранти з відкритих джерел: підготовчі питання до GRE, до ліцензійного іспиту лікарів США, до курсів бакалаврату, до книжок Oxford University Press. Тестова частина — 14 080 питань, у кожному предметі щонайменше сто. Предмети йдуть із рівнями складності: «елементарний», «шкільний», «університетський», «професійний». Число 57 автори пояснюють окремим жартом: стільки ж, скільки ігор Atari у стандартному наборі для навчання з підкріпленням. Про людський рівень тут треба говорити обережно, бо в першій версії препринта його немає взагалі. Він з'явився у третій, за січень 2021 року, і там це не вимір, а оцінка з застереженням самих авторів: беруть точність людини на 95-му процентилі для тих іспитів, з яких складено тест, а там, де такої інформації немає, — роблять, дослівно, «освічену здогадку»; звідси й виходить «приблизно 89,8 %». Виміряне число в тому ж абзаці інше й рідко цитується: непідготовлені люди з Amazon Mechanical Turk дають 34,5 %. Запис не стверджує, що 89,8 % — це зафіксований людський результат. Це оцінка, побудована з чужих процентилів і здогадок, і вона стала планкою, яку потім роками оголошували перевершеною.