Повернутися до часової лінії

Дослідження · 17 лютого 2025 р.

Розміщено за датою сучасного події першоджерела. Точна дата події невідома; нижче наведено підтверджений часовий інтервал.

Без верифікатора обчислення на відповідь програють

17 лютого 2025 року Карнеґі-Меллон і Берклі довели, що за однакового бюджету донавчання з верифікатором переважає наслідування чужих ланцюжків міркування, і що розрив між ними росте зі збільшенням обчислень на відповідь.

Чому це важливо

На той момент найдешевший спосіб зробити модель, що міркує, полягав у копіюванні готових ланцюжків у сильнішої моделі. Робота показала, що ця дешевизна має стелю: без сигналу перевірки приріст від довшого міркування вичерпується раніше, і що більше обчислень, то більший програш.

Розділено два класи. Методи з верифікатором збирають оцінку винагороди для власних розгортків базової моделі; методи без верифікатора переносять чужі сліди міркування, не питаючи жодного сигналу перевірки. Стаття прямо відносить сюди s1 і OpenThinker. Умова, за якої переважання виконується, названа явно: базова модель має бути різнорідною у своїх відповідях, тобто розподіл винагород на її власних слідах не має бути гострим. Автори формалізують це як антиконцентрацію. За неї методи з верифікатором виграють у вибірковій ефективності множник кореня з H, де H — довжина виведення. Перевірено і теоретично, і на моделях 3, 8 і 32 мільярдів параметрів, на дидактичній задачі та на справжніх математичних. Чого запис не стверджує. Переважання не безумовне: воно доведене за антиконцентрації, і стаття це підкреслює, а не подає як загальне правило. Робота не міряє готових продуктів і не каже, що дистиляція марна — вона каже, що та гірше масштабується.

Відомості про подію

Дата події
17 лютого 2025 р.
Дата на часовій лінії
Дата первинної публікації
Перевірка
Джерела зібрано автоматично · 22 вересня 2026 р.
Лінії
ID
evt-0568

День подання першої версії препринта. Пізніше arXiv додав другу; числа прочитано у першій.

Джерела

Пов’язані події

Записи, що посилаються на цей