Захват із замкненою петлею на 96 відсотках
QT-Opt навчили на понад 580 тисячах справжніх спроб захвату методом навчання з підкріпленням; політика дала 96% успіху на небачених предметах і сама виробила поведінку, якої їй не задавали.
Чому це важливо
Тут стратегія захвату перестала бути планом, обраним до початку руху, і стала політикою, яку переглядають щокадру. Перехоплення, обмацування предмета в пошуку кращої точки й зміщення предмета перед захватом вийшли з оптимізації, а не з голови проєктувальника.
Команда Google на чолі з Дмитром Калашниковим побудувала масштабовану самонавчальну систему навчання з підкріпленням для маніпуляції за зображенням. На понад 580 000 справжніх спроб захвату навчили Q-функцію з понад 1,2 мільйона параметрів. Сприйняття — лише RGB з однієї камери, поставленої над плечем робота. Політика узагальнилася до 96% успіху на предметах, яких не було в навчанні. Крім самої частки, у роботі перелічено поведінку, що виникла сама: повторний захват після невдалого, обмацування предмета в пошуку найзручнішої точки, зміщення предмета в зручніше положення, інші дії без утримання перед захватом і реакція на збурення й поштовхи. Це продовження ферми рук 2016 року, у якому передбачення з учителем замінили на навчання з підкріпленням.