Маніпуляція в долоні, навчена лише в симуляції
OpenAI навчила п’ятипалу руку Shadow перевертати кубик у долоні, тренуючи політику виключно в симуляції з випадковими фізичними властивостями; на залізі вона дала медіану в 13 успішних поворотів поспіль.
Чому це важливо
Спритна маніпуляція в долоні не піддавалася ні написанню вручну, ні навчанню на справжньому роботі. Випадковість у симуляції зробила її досяжною, взагалі не торкаючись заліза під час навчання, і саме це зробило шлях «із симуляції в реальність» правдоподібним для контактних задач, а не лише для ходьби.
Політику навчали в середовищі, де випадково змінювали коефіцієнти тертя, зовнішній вигляд предмета й інші фізичні властивості. Людських демонстрацій не було зовсім, але сама собою виникла поведінка, знайома з людської руки: перебирання пальцями, узгоджена робота кількох пальців і навмисне використання сили тяжіння. На фізичній установці медіана становила 13 успішних поворотів поспіль проти 50 у симуляції; у наведеній таблиці найкращий прогін на залізі дійшов до 50. Ціна такого перенесення теж названа: навчитися перевертати предмет у симуляції без випадковості коштує близько 3 років змодельованого досвіду, а з повною випадковістю — близько 100 років, що відповідає приблизно 1,5 та 50 годинам справжнього часу на їхній установці.