Повернутися до часової лінії

Дослідження · 19 листопада 2019 р.

MuZero: план без правил гри

19 листопада 2019 року Джуліан Шріттвізер і співавтори з DeepMind описали MuZero: пошук деревом поверх навченої моделі, якій не дають правил гри. На 57 іграх Atari вона встановила новий найкращий результат, а в го, шахах і сьоги зрівнялася з AlphaZero, яка правила знала.

Чому це важливо

Планування деревом перестало вимагати точного симулятора середовища. Модель вчиться передбачати лише те, що потрібне для планування, — винагороду, політику й цінність, — і тому той самий метод працює і в настільних іграх, і у візуально складних відеоіграх.

За першою версією препринта MuZero перевершила попередній найкращий метод R2D2 у 42 з 57 ігор Atari за середнім і медіанним нормованим балом, а модельний метод SimPLe — в усіх; у го трохи перевершила AlphaZero. Статтю в Nature опубліковано 23 грудня 2020 року; її текст не прочитано (доступ за передплатою), тож запис стверджує лише те, що є в препринті.

Відомості про подію

Дата події
19 листопада 2019 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 25 вересня 2026 р.
Лінії
ID
evt-0787

Перша версія препринта; стаття в Nature вийшла 23 грудня 2020 року.

Джерела

Пов’язані події