Зір і керування навчають як одне ціле
Сергій Левін, Челсі Фінн, Тревор Даррелл і Пітер Аббіль показали, що коли сприйняття і керування тренувати спільно, а не двома окремими ступенями, робот виконує контактні задачі вдвічі надійніше на найважчих із них.
Чому це важливо
Стандартний конвеєр спершу оцінював положення предмета, а тоді планував рух, тож похибка зору й похибка керування складалися. Спільне навчання прибрало цей стик і зробило зорові ознаки підзвітними тому рухові, який вони мають породити.
Мережа приблизно на 92 000 параметрів відображала сирі зображення з камери просто в моменти на приводах. Навчання йшло методом guided policy search у частково спостережуваному варіанті, який перетворює пошук політики на задачу навчання з учителем. Перевіряли на PR2 на чотирьох задачах, де зір і рух треба узгоджувати щільно: повісити плічка, вставити фігуру в сортер, підвести кіготь іграшкового молотка під цвях і закрутити кришку на пляшці. На найсуворішій умові — зоровому тесті — наскрізне навчання дало 100% на плічках, 87,5% на сортері, 78,3% на молотку і 62,5% на кришці. Для порівняння, та сама архітектура, але з ознаками у вигляді заздалегідь оціненого положення, давала 83,3%, 40%, 53,3% і 27,5% відповідно. Тобто на найважчій задачі частка успіху зросла з 27,5% до 62,5%.