Повернутися до часової лінії

Дослідження · 7 лютого 2025 р.

Розміщено за датою сучасного події першоджерела. Точна дата події невідома; нижче наведено підтверджений часовий інтервал.

Міркування глибиною, а не токенами

7 лютого 2025 року група з інституту ELLIS у Тюбінгені та Університету Меріленду показала архітектуру, яка думає довше не словами, а повторами: рекурентний блок розгортається на довільну глибину під час відповіді. Дослідну модель на 3,5 мільярда параметрів навчено на 800 мільярдах токенів.

Чому це важливо

Доти довше міркування означало більше токенів у вікні контексту, тобто ланцюжок думок, який займає місце й потребує даних із такими ланцюжками. Тут глибина стала окремою ручкою: думати довше можна, не написавши жодного зайвого слова.

Три властивості, які автори називають перевагою над ланцюжком думок: не потрібні спеціально зібрані дані з міркуваннями, вистачає малого вікна контексту, і в такому вигляді можна вловити міркування, яке погано лягає в слова. Межа виміряна й названа обережно. Стаття каже, що якість на тестах міркування росте, подеколи різко, до обчислювального навантаження, еквівалентного 50 мільярдам параметрів. Це саме про обсяг обчислень, а не про те, що модель на 3,5 мільярда зрівнялася з моделлю на 50 мільярдів за якістю — різниця істотна, і джерело другого твердження не подає. Чого запис не стверджує. Це дослідна модель, а не випуск; автори самі називають її proof-of-concept. Приріст описано як «подеколи різкий», без єдиного числа на всі тести.

Відомості про подію

Дата події
7 лютого 2025 р.
Дата на часовій лінії
Дата первинної публікації
Перевірка
Джерела зібрано автоматично · 22 вересня 2026 р.
Лінії
ID
evt-0574

День подання першої версії препринта. Пізніше arXiv додав другу; числа прочитано у першій.

Джерела

Пов’язані події