Дифузійні політики для керування за зображенням
Замість передбачати одну дію, Diffusion Policy подає рух робота як дифузійний процес над послідовностями дій; на 12 задачах із чотирьох наявних тестових наборів це дало в середньому 46,9% приросту над попередніми методами.
Чому це важливо
Клонування поведінки псувало усереднення: коли правильних рухів два, регресія видає щось середнє між ними, тобто третій і неправильний. Моделювання розподілу дій замість його середнього прибрало цю ваду, і дифузія стала стандартним виходом для універсальних політик, що з’явилися далі.
Ченг Чі, Женьцзя Сюй, Сююань Фен, Ерік Кузіно, Ілунь Ду, Бенджамін Берчфіл, Расс Тедрейк і Шуран Сон працювали разом від Колумбійського університету, Toyota Research Institute і MIT. Політику подано як умовний дифузійний процес знешумлення над послідовностями дій, що дає змогу мати справу з багатомодальними розподілами, де кілька різних рухів однаково правильні. Перевіряли на 12 різних задачах із 4 різних наборів для маніпуляції, тобто проти вже опублікованих чужих базових результатів, а не проти власної попередньої версії. Середній приріст — 46,9%.