Повернутися до часової лінії

Дослідження · 7 березня 2023 р.

Дифузійні політики для керування за зображенням

Замість передбачати одну дію, Diffusion Policy подає рух робота як дифузійний процес над послідовностями дій; на 12 задачах із чотирьох наявних тестових наборів це дало в середньому 46,9% приросту над попередніми методами.

Чому це важливо

Клонування поведінки псувало усереднення: коли правильних рухів два, регресія видає щось середнє між ними, тобто третій і неправильний. Моделювання розподілу дій замість його середнього прибрало цю ваду, і дифузія стала стандартним виходом для універсальних політик, що з’явилися далі.

Ченг Чі, Женьцзя Сюй, Сююань Фен, Ерік Кузіно, Ілунь Ду, Бенджамін Берчфіл, Расс Тедрейк і Шуран Сон працювали разом від Колумбійського університету, Toyota Research Institute і MIT. Політику подано як умовний дифузійний процес знешумлення над послідовностями дій, що дає змогу мати справу з багатомодальними розподілами, де кілька різних рухів однаково правильні. Перевіряли на 12 різних задачах із 4 різних наборів для маніпуляції, тобто проти вже опублікованих чужих базових результатів, а не проти власної попередньої версії. Середній приріст — 46,9%.

Відомості про подію

Дата події
7 березня 2023 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 20 вересня 2026 р.
Лінії
ID
evt-0437

Дата подання першої версії на arXiv; роботу представили на RSS 2023.

Джерела

Записи, що посилаються на цей