Повернутися до часової лінії

Дослідження · 31 липня 2024 р.

Розміщено за датою сучасного події першоджерела. Точна дата події невідома; нижче наведено підтверджений часовий інтервал.

Покриття росте з кількістю спроб

31 липня 2024 року група зі Стенфорда, Оксфорда й Google DeepMind показала, що частка розв'язаних задач росте з кількістю згенерованих спроб на чотирьох порядках. На SWE-bench Lite DeepSeek-V2-Coder-Instruct піднявся з 15,9 % за однієї спроби до 56 % за 250.

Чому це важливо

Доти обчислення на відповідь означало довший ланцюжок міркування однієї спроби. Стаття виміряла інший, простіший спосіб — просто повторювати — і показала, що 56 % дешевої моделі з 250 спроб обходять 43 % найкращого одиничного результату на дорожчих моделях того часу.

Залежність покриття (частки задач, розв'язаних бодай однією спробою) від кількості спроб описується експоненційним степеневим законом і тримається на чотирьох порядках. На GSM8K і MATH покриття моделей Llama-3 переходить 95 % за 10 тисяч спроб. Запис не стверджує, що повторення розв'язує задачу саме по собі. Воно перетворюється на результат лише там, де відповідь перевіряється автоматично — код і формальні доведення. Автори окремо показують межу: там, де автоматичного верифікатора немає, звичайні способи вибрати правильну спробу з-поміж багатьох — голосування більшістю й модель винагороди — виходять на плато після кількох сотень спроб і за бюджетом вибірки не встигають. Перша авторка й Рональд Кларк працюють в Оксфорді, решта — у Стенфорді та Google DeepMind; приписувати роботу самому лише Стенфордові неточно.

Відомості про подію

Дата події
31 липня 2024 р.
Дата на часовій лінії
Дата первинної публікації
Перевірка
Джерела зібрано автоматично · 21 вересня 2026 р.
Лінії
ID
evt-0527

День подання першої версії препринта. Пізніші версії з'явилися у вересні й грудні 2024 року; числа цього запису прочитано у першій.

Джерела

Пов’язані події

Записи, що посилаються на цей