Дрібні та спільні експерти
11 січня 2024 року DeepSeek опублікувала архітектуру, у якій блок FFN ділиться на багато дрібних експертів, а частина з них завжди ввімкнена. DeepSeekMoE 16B обійшла LLaMA2 7B на більшості тестів, витрачаючи 39,6 % обчислень.
Чому це важливо
Доти суміш експертів була способом здешевити велику модель. Ця робота назвала, чому дешевша модель буває й кращою: коли експерти великі й кожен має вміти все потроху, знання в них дублюються, а дрібний поділ із виділеним спільним ядром це дублювання прибирає.
Два прийоми. Перший — дрібний поділ: проміжна розмірність FFN ділиться на m частин, і замість одного-двох великих експертів вмикається mK дрібних, що комбінаторно розширює простір спеціалізацій. Другий — виділені спільні експерти, які працюють на кожному токені незалежно від маршрутизатора й тримають те загальне, що інакше довелося б повторювати в кожному експерті. Числа першої версії. DeepSeekMoE 16B має 245 % параметрів LLaMA2 7B, але потребує 39,6 % обчислень, і при цьому перевершує її на більшості внутрішніх тестів; обидві навчено на 2 трильйонах токенів. Проти власної щільної DeepSeek 7B — зіставна якість за 40,5 % обчислень. На малому масштабі DeepSeekMoE 2B зрівнюється з GShard 2,9B, яка має в 1,5 раза більше параметрів експертів і обчислень. Стаття сама називає стелю: DeepSeekMoE 2B лише «наближається» до щільної моделі з тим самим числом параметрів, тобто з 16-разово більшим FFN, і саме це автори вважають верхньою межею для сумішей експертів.