Довгий контекст усередині навчання з підкріпленням
22 січня 2025 року Moonshot AI описала Kimi k1.5, де контекстне вікно розтягнуто до 128 тисяч токенів не на виведенні, а в самій фазі навчання з підкріпленням. Модель дає 77,5 на AIME і 96,2 на MATH-500, зрівнюючись із o1.
Чому це важливо
Доти довгий контекст був властивістю готової моделі. Тут він став умовою навчання: що довше модель може міркувати під час самого підкріплення, то краще вчиться, і звіт показує, що якість росте разом із цією довжиною.
Числа довгого ланцюжка з першої версії: 77,5 на AIME, 96,2 на MATH-500, 94-й процентиль на Codeforces, 74,9 на MathVista. Модель міркує спільно над текстом і зображенням, тож MathVista тут не стороннє число. Окремий результат — long2short: прийоми довгого ланцюжка переносять у моделі з коротким виведенням через штраф за довжину, злиття моделей, відбір найкоротшої відповіді та DPO. Це дає 60,8 на AIME, 94,6 на MATH500 і 47,3 на LiveCodeBench, що звіт називає перевагою над GPT-4o і Claude Sonnet 3.5 до 550 відсотків. Щоб навчання з таким вікном було можливим, запроваджено часткові повторні запуски: довгий розгорток не починають щоразу з нуля. Навчання йде двома епохами — спершу на 32 тисячах токенів, потім на 128 тисячах. Чого запис не стверджує. Звіт не називає окремих авторів — він підписаний «Kimi Team». Приріст у 550 відсотків — це верхня межа по одному з тестів, а не типова величина.