Вартість відповіді визначає пам'ять, не параметри
5 червня 2025 року Карнеґі-Меллон перерахував закони масштабування обчислень на відповідь із урахуванням заліза й дістав протилежний висновок: користь малих моделей істотно переоцінено, а ресурси спершу варто вкладати в розмір моделі приблизно до 14 мільярдів параметрів.
Чому це важливо
Попередні роботи року рахували обчислення й доходили до того, що мала модель із довгим міркуванням вигідніша за велику. Цей перерахунок додав те, чого вони не рахували, — доступ до пам'яті в механізмі уваги, — і саме воно виявилося визначальним для вартості, а не кількість параметрів.
Аналіз охоплює моделі від 0,6 до 32 мільярдів параметрів і стратегії на кшталт best-of-N і довгих ланцюжків думок. Висновок сформульовано як порядок витрат: спершу нарощувати модель до критичного порога, емпірично близько 14 мільярдів, і лише потім вкладатися в обчислення на відповідь. Звідси випливає й друге: якщо вузьке місце — увага, то розріджена увага знижує вартість токена й дозволяє за той самий бюджет або довше породжувати, або брати більше паралельних спроб. Розріджені моделі дають понад 60 пунктів приросту точності на AIME у режимі малих витрат і понад 5 пунктів у режимі великих; за розрахунком статті це до трьох разів менше ресурсів на ту саму точність. Чого запис не стверджує. Поріг у 14 мільярдів названо емпіричним, а не виведеним, і він стосується перевірених моделей і стратегій. Приріст у понад 60 пунктів — це режим малих витрат на AIME, а не типова величина: у режимі великих витрат він падає до понад 5.