Мовна модель на 0,94 гігабайта тексту
11 листопада 2021 року Келечі Огведжі, Юйсінь Чжу та Джиммі Лін показали AfriBERTa — багатомовну модель, навчену з нуля лише на одинадцяти африканських мовах на корпусі 0,94 гігабайта, тобто 108,8 мільйона токенів. XLM-R для порівняння навчали на 2395 гігабайтах і 164 мільярдах токенів, mBERT — на 100 гігабайтах і 12,8 мільярда.
Чому це важливо
Доти багатомовна модель для мови з малим цифровим слідом будувалася як додаток до великої: мову клали поруч із англійською й сподівалися на перенесення. Тут уперше показано, що для чотирьох із цих одинадцяти мов першу модель узагалі можна зробити без англійської та без терабайтів — на корпусі, який уміщається на одному диску.
Корпус зібрано переважно з новин Всесвітньої служби Бі-Бі-Сі, вичерпаних до 17 січня 2021 року, і доповнено вибіркою Common Crawl; це 5 448 911 речень. AfriBERTa large має 126 мільйонів параметрів проти 270 мільйонів у XLM-R base і 172 мільйонів у mBERT. Оцінювали на розпізнаванні іменованих сутностей MasakhaNER і на класифікації новин; охоплено десять мов, зокрема чотири, яких у навчальному корпусі не було. Чого запис не стверджує. Модель не перевершує mBERT і XLM-R загалом: стаття каже, що AfriBERTa large перевершує mBERT і дуже конкурентна з XLM-R, а на кількох мовах — гауса, амхарська, суахілі — перевершує обидві. На нігерійському піджині обидві великі моделі кращі за неї, і автори пояснюють це його близькістю до англійської. Звіт, з якого взято кандидата, подавав це як перемогу над обома. Звіт посилався на arXiv:2103.11811. Цей ідентифікатор належить MasakhaNER — тестовому набору, на якому AfriBERTa вимірювалася, а не самій AfriBERTa; дата 22 березня 2021 року, яку звіт назвав датою випуску, є датою подання тієї іншої роботи.