SWE-bench: справжні задачі з GitHub
10 жовтня 2023 року Карлос Хіменес, Джон Ян і співавтори з Принстона оприлюднили SWE-bench — 2 294 задачі з реальних issue та pull request дванадцяти популярних репозиторіїв Python. Модель отримує кодову базу й опис проблеми й має змінити код так, щоб пройшли тести. Claude 2 розв'язав 4,8 %, GPT-4 — 1,7 %.
Чому це важливо
Оцінювання коду перейшло від окремих функцій до роботи в цілому репозиторії: треба знайти потрібні файли, змінити кілька місць одразу й працювати з дуже довгим контекстом. Саме на цьому наборі 2024 року міряли агентів, про яких є записи атласу.
4,8 % і 1,7 % — з «оракульним» пошуком, який дає моделі файли з еталонного виправлення; із пошуком BM25 Claude 2 розв'язав 1,96 %. GPT-4 через бюджет оцінено лише на випадковій чверті задач. Задачі відібрано з 90 000 pull request. Автори також дообучили SWE-Llama на 7 і 13 мільярдів параметрів на основі CodeLlama. Препринт називає HumanEval чинним стандартом оцінювання генерації коду.