Міркування глибиною, а не токенами
7 лютого 2025 року група з інституту ELLIS у Тюбінгені та Університету Меріленду показала архітектуру, яка думає довше не словами, а повторами: рекурентний блок розгортається на довільну глибину під час відповіді. Дослідну модель на 3,5 мільярда параметрів навчено на 800 мільярдах токенів.
Чому це важливо
Доти довше міркування означало більше токенів у вікні контексту, тобто ланцюжок думок, який займає місце й потребує даних із такими ланцюжками. Тут глибина стала окремою ручкою: думати довше можна, не написавши жодного зайвого слова.
Три властивості, які автори називають перевагою над ланцюжком думок: не потрібні спеціально зібрані дані з міркуваннями, вистачає малого вікна контексту, і в такому вигляді можна вловити міркування, яке погано лягає в слова. Межа виміряна й названа обережно. Стаття каже, що якість на тестах міркування росте, подеколи різко, до обчислювального навантаження, еквівалентного 50 мільярдам параметрів. Це саме про обсяг обчислень, а не про те, що модель на 3,5 мільярда зрівнялася з моделлю на 50 мільярдів за якістю — різниця істотна, і джерело другого твердження не подає. Чого запис не стверджує. Це дослідна модель, а не випуск; автори самі називають її proof-of-concept. Приріст описано як «подеколи різкий», без єдиного числа на всі тести.