Повернутися до часової лінії

Доступність · 13 червня 2024 р.

Відкриті ваги для моделі «зір-мова-дія»

OpenVLA на 7 мільярдів параметрів виклали з відкритими вагами; на 29 задачах вона перевершила закриту RT-2-X на 55 мільярдів параметрів на 16,5 відсоткового пункту абсолютного успіху, маючи приблизно всемеро менше параметрів.

Чому це важливо

Доти кожна передова роботична політика була всередині однієї компанії. Модель, яку можна просто завантажити і яка при цьому перевершує закриту на спільному наборі задач, означала, що лабораторія без флоту роботів може починати з переднього краю, а не з нуля.

Роботу зробили спільно Стенфорд, Берклі, Toyota Research Institute і Google DeepMind. Модель побудовано на мовній моделі Llama 2 з візуальним кодувальником, що поєднує ознаки DINOv2 і SigLIP, і навчено на 970 000 справжніх роботичних демонстрацій. Оцінювання охопило 29 задач і кілька різних роботичних тіл. Перевага над RT-2-X — 16,5 відсоткового пункту абсолютної частки успіху, при тому що в RT-2-X 55 мільярдів параметрів проти 7 мільярдів тут. Донавчати модель можна на споживчому залізі, що й робить відкритість практичною, а не номінальною.

Відомості про подію

Дата події
13 червня 2024 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 22 вересня 2026 р.
Лінії
ID
evt-0444

Дата подання першої версії на arXiv.

Джерела

Пов’язані події