Повернутися до часової лінії

Дослідження · 1 серпня 2018 р.

Маніпуляція в долоні, навчена лише в симуляції

OpenAI навчила п’ятипалу руку Shadow перевертати кубик у долоні, тренуючи політику виключно в симуляції з випадковими фізичними властивостями; на залізі вона дала медіану в 13 успішних поворотів поспіль.

Чому це важливо

Спритна маніпуляція в долоні не піддавалася ні написанню вручну, ні навчанню на справжньому роботі. Випадковість у симуляції зробила її досяжною, взагалі не торкаючись заліза під час навчання, і саме це зробило шлях «із симуляції в реальність» правдоподібним для контактних задач, а не лише для ходьби.

Політику навчали в середовищі, де випадково змінювали коефіцієнти тертя, зовнішній вигляд предмета й інші фізичні властивості. Людських демонстрацій не було зовсім, але сама собою виникла поведінка, знайома з людської руки: перебирання пальцями, узгоджена робота кількох пальців і навмисне використання сили тяжіння. На фізичній установці медіана становила 13 успішних поворотів поспіль проти 50 у симуляції; у наведеній таблиці найкращий прогін на залізі дійшов до 50. Ціна такого перенесення теж названа: навчитися перевертати предмет у симуляції без випадковості коштує близько 3 років змодельованого досвіду, а з повною випадковістю — близько 100 років, що відповідає приблизно 1,5 та 50 годинам справжнього часу на їхній установці.

Відомості про подію

Дата події
1 серпня 2018 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 20 вересня 2026 р.
Лінії
ID
evt-0431

Дата подання першої версії на arXiv. Власний допис OpenAI датовано трохи раніше, але openai.com відмовляє автоматичному зверненню, тож за дату взято публікацію препринта.

Джерела

Пов’язані події

Записи, що посилаються на цей