MuZero: план без правил гри
19 листопада 2019 року Джуліан Шріттвізер і співавтори з DeepMind описали MuZero: пошук деревом поверх навченої моделі, якій не дають правил гри. На 57 іграх Atari вона встановила новий найкращий результат, а в го, шахах і сьоги зрівнялася з AlphaZero, яка правила знала.
Чому це важливо
Планування деревом перестало вимагати точного симулятора середовища. Модель вчиться передбачати лише те, що потрібне для планування, — винагороду, політику й цінність, — і тому той самий метод працює і в настільних іграх, і у візуально складних відеоіграх.
За першою версією препринта MuZero перевершила попередній найкращий метод R2D2 у 42 з 57 ігор Atari за середнім і медіанним нормованим балом, а модельний метод SimPLe — в усіх; у го трохи перевершила AlphaZero. Статтю в Nature опубліковано 23 грудня 2020 року; її текст не прочитано (доступ за передплатою), тож запис стверджує лише те, що є в препринті.