Часткове перевстановлення ваг експерта
26 лютого 2025 року Institute of Science Tokyo й Sakana AI показали, як починати навчання суміші експертів із готової щільної моделі, перевстановлюючи лише частину ваг кожного експерта. Модель із 5,9 мільярда активних параметрів зрівнялася зі щільною на 13 мільярдів за приблизно чверть обчислень навчання.
Чому це важливо
Доти суміш експертів або вчили з нуля, або збирали з копій готового щільного блоку. Перший спосіб дорогий, другий дає експертів, які всі однакові й не спеціалізуються. Часткове перевстановлення дало середину: початок лишається дешевим, а експерти розходяться.
Прийом у тому, що при копіюванні щільного блоку в експертів частину ваг кожної копії скидають і вчать наново. Це руйнує симетрію між копіями, не втрачаючи всього, що модель уже знає. Числа першої версії: суміш із 5,9 мільярда активних параметрів дає якість щільної моделі на 13 мільярдів із того самого сімейства, витрачаючи приблизно чверть обчислень навчання. Код і ваги відкриті. Чого запис не стверджує. Автори прямо обмежують результат довгим навчанням: перевага виявляється «у довгостроковій перспективі, а саме коли навчають на сотнях мільярдів токенів або більше». На коротких прогонах вона не заявлена.