Без верифікатора обчислення на відповідь програють
17 лютого 2025 року Карнеґі-Меллон і Берклі довели, що за однакового бюджету донавчання з верифікатором переважає наслідування чужих ланцюжків міркування, і що розрив між ними росте зі збільшенням обчислень на відповідь.
Чому це важливо
На той момент найдешевший спосіб зробити модель, що міркує, полягав у копіюванні готових ланцюжків у сильнішої моделі. Робота показала, що ця дешевизна має стелю: без сигналу перевірки приріст від довшого міркування вичерпується раніше, і що більше обчислень, то більший програш.
Розділено два класи. Методи з верифікатором збирають оцінку винагороди для власних розгортків базової моделі; методи без верифікатора переносять чужі сліди міркування, не питаючи жодного сигналу перевірки. Стаття прямо відносить сюди s1 і OpenThinker. Умова, за якої переважання виконується, названа явно: базова модель має бути різнорідною у своїх відповідях, тобто розподіл винагород на її власних слідах не має бути гострим. Автори формалізують це як антиконцентрацію. За неї методи з верифікатором виграють у вибірковій ефективності множник кореня з H, де H — довжина виведення. Перевірено і теоретично, і на моделях 3, 8 і 32 мільярдів параметрів, на дидактичній задачі та на справжніх математичних. Чого запис не стверджує. Переважання не безумовне: воно доведене за антиконцентрації, і стаття це підкреслює, а не подає як загальне правило. Робота не міряє готових продуктів і не каже, що дистиляція марна — вона каже, що та гірше масштабується.