DQN грає в Atari
Мережа вчилася грати в сім ігор Atari, отримуючи лише пікселі екрана і рахунок, і перевершила людину в трьох із них.
Чому це важливо
Один алгоритм без жодних правил гри навчився різних задач з нуля — саме це переконало, що навчання з підкріпленням масштабується.
Попередні системи потребували ознак, написаних під кожну гру. DQN отримував те саме, що й людина: зображення і число. Головними технічними прийомами стали буфер відтворення досвіду і окрема цільова мережа, що стабілізували навчання. За півроку після публікації Google придбала DeepMind. Версія 2015 року в Nature покрила сорок дев'ять ігор.