HumanEval: код, перевірений тестами
7 липня 2021 року Марк Чен і співавтори з OpenAI оприлюднили HumanEval — 164 написані вручну задачі на Python із модульними тестами. Codex розв'язав 28,8 % з першої спроби, GPT-3 — 0 %, GPT-J — 11,4 %; зі 100 спробами на задачу — 70,2 %.
Чому це важливо
Код почали оцінювати не схожістю тексту на еталон, а тим, чи проходить він тести, — метрикою pass@k. Той самий препринт показав, що повторна вибірка з моделі дає робочі розв'язки там, де одна спроба їх не дає.
Навчальні дані Codex зібрано в травні 2020 року з 54 мільйонів публічних репозиторіїв GitHub: 179 ГБ унікальних файлів Python до 1 МБ, після фільтрації — 159 ГБ. Задачі HumanEval написано вручну, щоб їх не було серед цих даних. Модель, дообучена на окремо зібраних задачах, Codex-S, розв'язала 37,7 % з першої спроби.