Повернутися до часової лінії

Бенчмарк · 7 липня 2021 р.

HumanEval: код, перевірений тестами

7 липня 2021 року Марк Чен і співавтори з OpenAI оприлюднили HumanEval — 164 написані вручну задачі на Python із модульними тестами. Codex розв'язав 28,8 % з першої спроби, GPT-3 — 0 %, GPT-J — 11,4 %; зі 100 спробами на задачу — 70,2 %.

Чому це важливо

Код почали оцінювати не схожістю тексту на еталон, а тим, чи проходить він тести, — метрикою pass@k. Той самий препринт показав, що повторна вибірка з моделі дає робочі розв'язки там, де одна спроба їх не дає.

Навчальні дані Codex зібрано в травні 2020 року з 54 мільйонів публічних репозиторіїв GitHub: 179 ГБ унікальних файлів Python до 1 МБ, після фільтрації — 159 ГБ. Задачі HumanEval написано вручну, щоб їх не було серед цих даних. Модель, дообучена на окремо зібраних задачах, Codex-S, розв'язала 37,7 % з першої спроби.

Відомості про подію

Дата події
7 липня 2021 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 25 вересня 2026 р.
Лінії
ID
evt-0788

Перша версія препринта.

Джерела

Пов’язані події

Записи, що посилаються на цей