Закони масштабування для розріджених автокодувальників
6 червня 2024 року OpenAI показала, що розкладання активацій на ознаки саме підкоряється законам масштабування. Автокодувальник на 16 мільйонів ознак навчено на активаціях GPT-4 за 40 мільярдів токенів, і мертвими лишилися 7 % ознак.
Чому це важливо
За два тижні до того стало ясно, що ознаки з робочої моделі дістати можна. Ця робота зробила з цього інженерію: замість підбирати штраф за розрідженість, кількість активних ознак задають прямо, а скільки треба даних і обчислень — рахують наперед.
Заміна L1-штрафу функцією TopK, яка лишає рівно k найбільших активацій, знімає дві біди одразу: розрідженість тепер задається числом, а не підбором коефіцієнта, і зникає усадка амплітуд, яку L1 вносить за побудовою. Мертві ознаки прибирають ініціалізацією енкодера транспонованим декодером і допоміжним лоссом на найбільших мертвих ознаках. Масштаб проблеми, від якої відштовхувалися: без цих заходів у власних абляціях мертвими ставали до 90 % ознак, а в роботі Anthropic автокодувальник на 34 мільйони мав лише 12 мільйонів живих. З ними в найбільшому автокодувальнику на 16 мільйонів мертвих 7 %. Закон збіжності: кількість токенів до збіжності росте приблизно як Θ(n^0,6) для GPT-2 small і Θ(n^0,65) для GPT-4, тобто сублінійно від кількості ознак. Автори самі кажуть, що так тривати не може: за сублінійного бюджету кожній ознаці врешті діставатиметься замало сигналу, тож десь закон зламається.