Захват небачених предметів, вивчений на синтетиці
Ашутош Саксена, Джастін Дрімаєр, Джастін Кернс і Ендрю Ин навчили алгоритм знаходити точку захвату просто на зображенні, тренуючи його лише на синтетичних картинках; на справжніх предметах, яких не було в навчанні, робот підняв 87,5% спроб.
Чому це важливо
До цього захват нового предмета вимагав побудувати його тривимірну модель. Тут моделі немає взагалі: система передбачає точку захвату як функцію зображення, і це переносилося на предмети, яких вона ніколи не бачила — прозору склянку, моток дроту, дивної форми ріжок.
Навчання йшло на 2500 синтетичних прикладів із шести класів предметів, згенерованих комп’ютерною графікою; жодного справжнього зображення в навчальній вибірці не було. У роботі це сказано прямо: «Although training was done on synthetic images, testing was done on the real robotic arm and real objects». Платформа — STAIR, мобільний робот Стенфордського університету, з рукою Neuronics Harmonic Arm: 4 кг, 5 ступенів свободи, паралельний захват, точність позиціювання близько 1 мм, і дешева вебкамера біля схвата. Кожен предмет пробували чотири рази. На предметах, яких не було в навчанні, середня частка успіху становила 87,5%, на схожих на навчальні — 90%. Середня похибка визначення точки захвату — 1,85 см на небачених і 1,80 см на схожих; для порівняння автори наводять 1,5 см у новонароджених людей. Класифікація того, чи є ділянка зображення проєкцією точки захвату, давала 94,2% на синтетичному тесті. Прозору склянку робот піднімав у 100% спроб, і так само, коли вона була на дві третини наповнена водою. Мугли й глеки, які треба брати за ручку, давали найгірший результат, бо траєкторія підходу там вузька.