Рука робота складає кубик Рубіка
OpenAI навчила ту саму руку Shadow складати кубик Рубіка, породжуючи щораз важчі симульовані середовища автоматично; частка успіху склала 60% на половинному перемішуванні й 20% на повному.
Чому це важливо
Там, де рік тому людина мусила сама обрати міру випадковості, тепер програма будувала цю послідовність сама, а тривалість задачі зросла з кількох секунд перевертання до багатохвилинної послідовності. Чесні 60% і 20% — теж частина причини, чому це запис, а не ролик.
Метод названо Automatic Domain Randomization: замість сталого діапазону випадковості, заданого вручну, він розширює діапазон у міру того, як політика справляється. Найкраща політика, ADR XXL, використовувала зір для оцінювання положення кубика і кубик Giiker із давачами для стеження за кутами граней. За десяти випробувань на кожному режимі вона склала половинне перемішування, що потребує 15 поворотів граней, у 60% випадків, і повне перемішування, що потребує 26 поворотів, у 20% випадків. Політику маніпуляції навчали тільки в симуляції. Сам алгоритм розв’язання кубика тут не є предметом: складність у тому, щоб рука фізично виконала потрібну послідовність поворотів, не впустивши кубик.