Інтерфейс середовища як важіль для агента
6 травня 2024 року Принстон показав SWE-agent: не нову модель, а командне середовище, перероблене під мовну модель. GPT-4 Turbo у ньому розв'язав 12,47 % із 2294 задач SWE-bench проти 3,8 % у найкращого доти неінтерактивного підходу з пошуком.
Чому це важливо
Доти приріст на таких задачах шукали в самій моделі. Робота виміряла інше: та сама модель із переробленим інтерфейсом дає більш ніж утричі кращий результат, тобто спосіб показати середовище виявився важелем, порівнянним із вагами.
Що саме в інтерфейсі. Файл показується вікном щонайбільше на 100 рядків із командами прокрутки й переходу на рядок; редагування замінює вказаний фрагмент; у команду редагування вбудовано лінтер, який показує моделі синтаксичну помилку до того, як зміну застосовано; пошук повертає згорнутий підсумок, а не весь вивід. Абляція на підвибірці з 300 задач показує ціну кожного рішення: редагування з лінтером 18,0 проти 15,0 без нього; вікно на 100 рядків проти 14,3 для вікна на 30; згорнутий пошук 18,0 проти 12,0 для покрокового; звичайний командний рядок замість редактора 10,3. Що запис не стверджує. 12,47 % — це GPT-4 Turbo; Claude 3 Opus у тому самому середовищі дає 10,46 %. Твердження, ніби лінтер звів некоректні зміни «практично до нуля», джерело не подає: воно дає приріст у три пункти на підвибірці. Число 3,8 % — це попередній найкращий результат підходу з пошуком, а не діапазон.