Розріджений шар суміші експертів
23 січня 2017 року Ноам Шазір і співавтори з Google Brain, серед них Джеффрі Дін і Джеффрі Гінтон, виклали шар з тисяч мереж-експертів, з яких навчуваний вентиль обирає для кожного прикладу лише кілька (зашумлений вибір top-k). Вставлений між шарами LSTM, він дав моделі до 137 млрд параметрів і, за словами авторів, понад 1000-кратне зростання місткості за незначної втрати обчислювальної ефективності. На WMT'14 — 40,56 BLEU для англійська–французька і 26,03 для англійська–німецька.
Чому це важливо
Місткість моделі відокремилася від обчислень на один приклад: параметрів може бути на порядки більше, а кожен токен однаково проходить крізь жменю експертів. Умовні обчислення, які раніше пропонували в теорії, запрацювали в масштабі на кластерах GPU. DeepSeekMoE 2024 року називає цю статтю тією, що ввела суміш експертів у навчання мовних моделей.
Мовне моделювання на 100 млрд слів: перплексія на тесті поліпшувалася аж до 65 536 експертів (68 млрд параметрів), на 39 % нижче за обчислювально зрівняну базову модель, і погіршилася на 131 072 експертах, можливо, через надмірну розрідженість. Результати перекладу на 1,34 і 1,12 BLEU вищі за сильні базові моделі Wu et al. 2016 (GNMT). Один з авторів, Кшиштоф Мазяж, був у Ягеллонському університеті в Кракові. Шар стоїть між LSTM, а не в трансформері. Mixtral 8x7B у грудні 2023 року працює за тим самим принципом, але його оголошення цієї статті не цитує, і запис прямої лінії не стверджує.