Повернутися до часової лінії

Дослідження · 6 червня 2024 р.

Розміщено за датою сучасного події першоджерела. Точна дата події невідома; нижче наведено підтверджений часовий інтервал.

Закони масштабування для розріджених автокодувальників

6 червня 2024 року OpenAI показала, що розкладання активацій на ознаки саме підкоряється законам масштабування. Автокодувальник на 16 мільйонів ознак навчено на активаціях GPT-4 за 40 мільярдів токенів, і мертвими лишилися 7 % ознак.

Чому це важливо

За два тижні до того стало ясно, що ознаки з робочої моделі дістати можна. Ця робота зробила з цього інженерію: замість підбирати штраф за розрідженість, кількість активних ознак задають прямо, а скільки треба даних і обчислень — рахують наперед.

Заміна L1-штрафу функцією TopK, яка лишає рівно k найбільших активацій, знімає дві біди одразу: розрідженість тепер задається числом, а не підбором коефіцієнта, і зникає усадка амплітуд, яку L1 вносить за побудовою. Мертві ознаки прибирають ініціалізацією енкодера транспонованим декодером і допоміжним лоссом на найбільших мертвих ознаках. Масштаб проблеми, від якої відштовхувалися: без цих заходів у власних абляціях мертвими ставали до 90 % ознак, а в роботі Anthropic автокодувальник на 34 мільйони мав лише 12 мільйонів живих. З ними в найбільшому автокодувальнику на 16 мільйонів мертвих 7 %. Закон збіжності: кількість токенів до збіжності росте приблизно як Θ(n^0,6) для GPT-2 small і Θ(n^0,65) для GPT-4, тобто сублінійно від кількості ознак. Автори самі кажуть, що так тривати не може: за сублінійного бюджету кожній ознаці врешті діставатиметься замало сигналу, тож десь закон зламається.

Відомості про подію

Дата події
6 червня 2024 р.
Дата на часовій лінії
Дата первинної публікації
Перевірка
Джерела зібрано автоматично · 21 вересня 2026 р.
Лінії
ID
evt-0538

День подання першої й єдиної версії препринта.

Джерела

Пов’язані події