Повернутися до часової лінії

Дослідження · 27 червня 2018 р.

Захват із замкненою петлею на 96 відсотках

QT-Opt навчили на понад 580 тисячах справжніх спроб захвату методом навчання з підкріпленням; політика дала 96% успіху на небачених предметах і сама виробила поведінку, якої їй не задавали.

Чому це важливо

Тут стратегія захвату перестала бути планом, обраним до початку руху, і стала політикою, яку переглядають щокадру. Перехоплення, обмацування предмета в пошуку кращої точки й зміщення предмета перед захватом вийшли з оптимізації, а не з голови проєктувальника.

Команда Google на чолі з Дмитром Калашниковим побудувала масштабовану самонавчальну систему навчання з підкріпленням для маніпуляції за зображенням. На понад 580 000 справжніх спроб захвату навчили Q-функцію з понад 1,2 мільйона параметрів. Сприйняття — лише RGB з однієї камери, поставленої над плечем робота. Політика узагальнилася до 96% успіху на предметах, яких не було в навчанні. Крім самої частки, у роботі перелічено поведінку, що виникла сама: повторний захват після невдалого, обмацування предмета в пошуку найзручнішої точки, зміщення предмета в зручніше положення, інші дії без утримання перед захватом і реакція на збурення й поштовхи. Це продовження ферми рук 2016 року, у якому передбачення з учителем замінили на навчання з підкріпленням.

Відомості про подію

Дата події
27 червня 2018 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 20 вересня 2026 р.
Лінії
ID
evt-0430

Дата подання першої версії на arXiv.

Джерела

Пов’язані події