Повернутися до часової лінії

Дослідження · 16 жовтня 2019 р.

Рука робота складає кубик Рубіка

OpenAI навчила ту саму руку Shadow складати кубик Рубіка, породжуючи щораз важчі симульовані середовища автоматично; частка успіху склала 60% на половинному перемішуванні й 20% на повному.

Чому це важливо

Там, де рік тому людина мусила сама обрати міру випадковості, тепер програма будувала цю послідовність сама, а тривалість задачі зросла з кількох секунд перевертання до багатохвилинної послідовності. Чесні 60% і 20% — теж частина причини, чому це запис, а не ролик.

Метод названо Automatic Domain Randomization: замість сталого діапазону випадковості, заданого вручну, він розширює діапазон у міру того, як політика справляється. Найкраща політика, ADR XXL, використовувала зір для оцінювання положення кубика і кубик Giiker із давачами для стеження за кутами граней. За десяти випробувань на кожному режимі вона склала половинне перемішування, що потребує 15 поворотів граней, у 60% випадків, і повне перемішування, що потребує 26 поворотів, у 20% випадків. Політику маніпуляції навчали тільки в симуляції. Сам алгоритм розв’язання кубика тут не є предметом: складність у тому, щоб рука фізично виконала потрібну послідовність поворотів, не впустивши кубик.

Відомості про подію

Дата події
16 жовтня 2019 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 20 вересня 2026 р.
Лінії
ID
evt-0433

Дата подання першої версії на arXiv.

Джерела

Пов’язані події