ERNIE 2.0: попереднє навчання, що дописує завдання
29 липня 2019 року група Baidu на чолі з Юй Сунем виклала ERNIE 2.0 — схему, у якій до мовної моделі поступово додають нові завдання попереднього навчання й учать їх разом із попередніми, щоб вивчене не забувалося. Велика модель набрала 83,6 на прихованому тестовому наборі GLUE, на 3,1 % більше за BERT, і обійшла BERT на всіх десяти завданнях тесту.
Чому це важливо
Попереднє навчання перестало бути парою фіксованих завдань на кшталт вгадування пропущеного слова: до нього можна дописувати нові сигнали — імена, порядок речень, дискурсивні зв'язки — у будь-який момент. Результат виміряно на тесті, мітки якого тримає бенчмарк, а не автори.
Сім завдань трьох видів — на рівні слів, структури й змісту. Англійський корпус — Вікіпедія, BookCorpus, Reddit і дані Discovery для дискурсивних зв'язків, китайський — з пошуковика Baidu. Налаштування трансформера ті самі, що в BERT; базова модель має на GLUE 80,6. Китайською перевірено на дев'яти завданнях проти BERT і ERNIE 1.0. З XLNet порівняно лише на наборі розробки: XLNet результатів тесту не подав. Чого запис не стверджує: числа 16 з резюме — таблиці самої статті дають інший розклад; дня, коли ERNIE очолила таблицю GLUE, прочитати не вдалося, бо таблиця малюється скриптом.