Малій моделі передають не відповіді, а дії
23 травня 2025 року KAIST і KRAFTON показали дистиляцію агента: мала модель переймає в більшої не ланцюжки міркування, а траєкторії дій з пошуком і виконанням коду. Моделі на 0,5, 1,5 і 3 мільярди параметрів зрівнялися з моделями наступного щабля — 1,5, 3 і 7 мільярдів.
Чому це важливо
Доти передача вміння від великої моделі до малої означала копіювання того, що вчитель написав. Тут копіюють те, що вчитель зробив: коли й куди він поліз по відомості та який код виконав. Виявилося, що так мала модель дістає не знання вчителя, а спосіб їх добувати.
Два прийоми. Перший — first-thought prefix: учителя підштовхують почати з думки, і це підвищує якість траєкторій, які він породжує. Другий — самоузгоджене породження дій, що додає стійкості вже на етапі відповіді, коли мала модель діє самостійно. Порівняння ведеться не з базою, а з тим самим розміром, навченим звичайною дистиляцією ланцюжків думок: 0,5 мільярда з агентною дистиляцією йде врівень із 1,5 мільярда на ланцюжках, і так само на двох інших щаблях. Перевірено на восьми завданнях на міркування — фактологічних і математичних, із задачами як у межах, так і поза межами навчального розподілу. Чого запис не стверджує. Виграш описано як «конкурентність» із наступним щаблем, а не перевагу над ним. Запис не датовано 20 травня, як подавав звіт: історія подань arXiv дає 23 травня, і жодна версія на 20 травня не припадає.