Обчислення під час відповіді проти більшої моделі
6 серпня 2024 року чотири дослідники з Берклі та Google DeepMind виміряли, скільки дає обчислення під час відповіді. На задачах, де менша модель уже має ненульовий успіх, вона з такими обчисленнями обійшла модель у 14 разів більшу за тієї самої сумарної кількості операцій.
Чому це важливо
Доти залежність «більше обчислень під час відповіді — краща відповідь» була відома з практики, але не виміряна проти альтернативи витратити ті самі операції на розмір моделі. Стаття поставила обидва способи на одну вісь FLOPs і показала, де межа: там, де базова модель не має жодного успіху, виграє все-таки навчання.
Виміряно два механізми: пошук проти покрокової моделі винагороди (PRM) і послідовне переписування власної чернетки. Стратегія, що обирає механізм за складністю запиту, дала виграш ефективності у 2–4 рази проти звичайного best-of-N — стаття пише саме «2-4×» і «up to 4x less test-time compute», а не більше. Залежність від складності виявилася протилежною до очікуваної: на легших задачах, де модель уже видає розумну відповідь, краще працює послідовне переписування, а на важчих — незалежне паралельне семплювання або пошук деревом проти PRM. Запис не стверджує, що обчислення під час відповіді замінюють навчання. Автори прямо пишуть протилежне для найважчих запитів: там додаткові операції вигідніше вкласти в попереднє навчання, тобто обмін не є рівноцінним. Порівняння з 14-разово більшою моделлю тримається на умові, що менша модель на цих задачах уже має «somewhat non-trivial success rates»; поза цією умовою воно не заявлене.