Перший іспит для відкритих моделей українською
У травні 2024 року на воркшопі UNLP у Турині Олексій Сивокінь, Мар'яна Романишин і Роман Кислий підбили перше змагання з дотренування великих мовних моделей для української: лише відкриті ваги, які вміщаються в 16 ГБ відеопам'яті. На 751 питанні ЗНО 2020–2023 років найкраща команда набрала 0,49 точності, GPT-4 поза конкурсом — 0,61.
Чому це важливо
З'явилася відкрита, відтворювана мірка того, наскільки мала відкрита модель знає українську мову, літературу й історію і як пише українською, — з прихованим тестом, публічною таблицею на Codabench і людським оцінюванням. Вона ж зафіксувала розрив із закритою моделлю.
Навчальний набір — 3 063 питання ЗНО 2006–2019 років з історії України та української мови й літератури, без питань із зображеннями; 100 відкритих завдань написали двоє носіїв мови, а відповіді оцінили 63 добровольці, понад 300 суджень на модель, рейтингом TrueSkill. Зареєструвалися 22 команди, рішення подали три. На відкритих питаннях GPT-4 має 28,48, найкраща відкрита система — 25,05; висновок статті натомість пише 26,77, і запис бере число з таблиці. Переможці дотренували Mistral 7B, інші — Gemma і Vicuna-13B. Порядок авторів тут — як у PDF; сторінка антології дає інший. Звіт, з якого взято кандидата, пов'язав цю роботу з розпізнаванням мовлення 1968 року; зв'язку між ними немає.