Підказка з ланцюжком міркувань
28 січня 2022 року Джейсон Вей і шестеро колег з Google Brain виклали підказку з ланцюжком міркувань: вісім розв'язаних прикладів у підказці показують проміжні кроки перед кожною відповіддю, і модель далі пише такі кроки сама. У моделі на 137 млрд параметрів точність на шкільних задачах з математики GSM8K зросла з 6,3 % до 14,8 %, а з зовнішнім калькулятором — до 19,5 % проти 18 % у GPT-3 175B, донавченої з калькулятором; на MultiArith — з 7,6 % до 45,0 %.
Чому це важливо
Міркування стало можливо видобути з великої моделі формою підказки, без навчання, і виграш з'являвся лише близько 100 млрд параметрів: менші моделі писали плавні, але нелогічні ланцюжки й робили гірше, ніж зі звичайною підказкою. У 2024 році o1 робить ланцюжок міркувань тим, що навчається з підкріпленням.
Перша версія перевіряє модель на 137 млрд параметрів (LaMDA-PT, навчена на 2,49 трлн токенів) і GPT-3 davinci. PaLM 540B і 58 % на GSM8K, які зазвичай наводять для цієї статті, у першій версії не трапляються жодного разу й прийшли з пізніших версій. З 50 випадково обраних ланцюжків, що привели до хибної відповіді, 46 % були майже правильними, а 54 % мали серйозні помилки розуміння чи зв'язності. Абляції для моделі 137B показують, що виграш не дає ні саме рівняння, ні більша кількість токенів, ні міркування, записане після відповіді.