Повернутися до часової лінії

Бенчмарк · 10 жовтня 2023 р.

SWE-bench: справжні задачі з GitHub

10 жовтня 2023 року Карлос Хіменес, Джон Ян і співавтори з Принстона оприлюднили SWE-bench — 2 294 задачі з реальних issue та pull request дванадцяти популярних репозиторіїв Python. Модель отримує кодову базу й опис проблеми й має змінити код так, щоб пройшли тести. Claude 2 розв'язав 4,8 %, GPT-4 — 1,7 %.

Чому це важливо

Оцінювання коду перейшло від окремих функцій до роботи в цілому репозиторії: треба знайти потрібні файли, змінити кілька місць одразу й працювати з дуже довгим контекстом. Саме на цьому наборі 2024 року міряли агентів, про яких є записи атласу.

4,8 % і 1,7 % — з «оракульним» пошуком, який дає моделі файли з еталонного виправлення; із пошуком BM25 Claude 2 розв'язав 1,96 %. GPT-4 через бюджет оцінено лише на випадковій чверті задач. Задачі відібрано з 90 000 pull request. Автори також дообучили SWE-Llama на 7 і 13 мільярдів параметрів на основі CodeLlama. Препринт називає HumanEval чинним стандартом оцінювання генерації коду.

Відомості про подію

Дата події
10 жовтня 2023 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 25 вересня 2026 р.
Лінії
ID
evt-0792

Перша версія препринта.

Джерела

Пов’язані події