Дослідження · грудень 2017 р.
AlphaZero
Один алгоритм без жодних людських партій навчився шахів, сьоґі та го з нуля і переміг найсильніші програми в кожній грі.
Чому це важливо
Знання людей виявилося не просто непотрібним, а гальмівним: без нього система за години перевершила десятиліття напрацювань.
AlphaGo вчилася на партіях людей; AlphaZero отримувала лише правила. За чотири години вона перевершила Stockfish у шахах. Партії показали стиль, який гросмейстери описали як позиційно ризикований і нелюдський: жертви, які машина оцінювала інакше. Це дало найчистіший доказ тези, що для замкнених задач із чіткою метою людський досвід не є необхідним.
Відомості про подію
- Дата події
- грудень 2017 р.
- Дата на часовій лінії
- Дата події
- Перевірка
- Джерела зібрано автоматично · 17 вересня 2026 р.
- Лінії
- ID
- evt-0235
Препринт від 5 грудня 2017 року.
Записи, що посилаються на цей
- Пов’язано AlphaDev
Той самий підхід гри сама проти себе, перенесений на пошук у просторі інструкцій процесора.
- Пов’язано AlphaGeometry
Той самий підхід пошуку під керунком навченої моделі, перенесений із гри у формальну математику.
- Спирається на Срібло Міжнародної математичної олімпіади
AlphaProof навчається грою проти себе в просторі формальних доведень.
AI achieves silver-medal standard solving International Mathematical Olympiad problems - Спирається на AlphaStar у StarCraft II
DeepMind виводить AlphaStar із лінії самонавчання, у якій AlphaGo й AlphaZero досягли надлюдської гри в го, шахи й сьоги.
AlphaStar: Grandmaster level in StarCraft II using multi-agent reinforcement learning (DeepMind blog) - Розвиває MuZero: план без правил гри
MuZero досягає рівня AlphaZero в го, шахах і сьоги, не отримуючи правил, які AlphaZero давали.
Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model (Schrittwieser et al., arXiv:1911.08265v1)