Два кроки замість агентної петлі
1 липня 2024 року Іллінойський університет показав Agentless: жорсткий двокроковий конвеєр — знайти місце, потім полагодити, — без автономних викликів інструментів. На SWE-bench Lite він дав 27,33 % за 0,34 долара на задачу, найкраще й найдешевше серед відкритих підходів.
Чому це важливо
Доти складність агента вважали тим, що дає приріст. Робота поставила поруч дешевий конвеєр без жодної петлі й показала, що серед відкритих систем він виграє — тобто частину приросту давала не автономія, а те, що навколо неї.
Конвеєр: ієрархічна локалізація від файлу до класу чи функції й до рядка, потім породження виправлень і вибір найкращого за тестами. Модель — GPT-4o (gpt-4o-2024-05-13). Побічний результат виявився важливішим за головний. Автори вручну перебрали SWE-bench Lite і знайшли, що 4,3 % задач містять готовий еталонний патч просто в описі проблеми, ще 10,0 % описують точні кроки до розв'язку, 9,3 % не мають відомостей, потрібних, щоб її розв'язати, і 4,3 % ведуть хибним слідом. З решти вони зібрали суворіший набір SWE-bench Lite-S. Що запис не стверджує. 27,33 % — найкращий результат лише серед відкритих підходів, а не взагалі: у таблиці статті вище стоять Alibaba Lingma Agent (33,00 %), Factory Code Droid (31,33 %), AutoCodeRover-v2 (30,67 %) і CodeR (28,33 %). Твердження, ніби 85 % невдач автономних агентів спричинені надмірною зміною файлів, у статті відсутнє.