Мільярд проти чотирьохсот п'яти
10 лютого 2025 року Шанхайська лабораторія ШІ й Цінхуа виміряли, як правильно розподіляти обчислення на відповідь. Модель на мільярд параметрів обійшла модель на 405 мільярдів на MATH-500, а модель на 7 мільярдів — o1 і DeepSeek-R1.
Чому це важливо
Доти обчислення на відповідь виглядали як спосіб трохи підтягнути модель. Тут виявилося, що при правильному розподілі вони перекривають різницю в розмірі у два-три порядки — тобто питання «яка модель потрібна» залежить від того, скільки їй дозволено думати.
Виміряно на MATH-500 і AIME24, з моделями винагороди від 1,5 до 72 мільярдів параметрів і кількома базовими моделями. Чотири порівняння з першої версії: модель на 1 мільярд обходить 405-мільярдну на MATH-500; модель на 0,5 мільярда обходить GPT-4o на обох тестах; модель на 3 мільярди обходить 405-мільярдну на обох; модель на 7 мільярдів обходить o1 і DeepSeek-R1, і при цьому дешевша у виведенні. Чого запис не стверджує. Перше з висновків самої статті — і саме його звіт про неї не переказує — полягає в тому, що оптимальний розподіл сильно залежить від трьох речей одразу: від базової моделі, від моделі винагороди й від складності задачі. Тобто це не універсальний прийом, який вмикають будь-де, а результат підбору під конкретну трійку. Порівняння стосуються математичних тестів, не завдань узагалі.