Повернутися до часової лінії

Дослідження · 28 липня 2023 р.

Модель, навчена на вебі, видає дії робота

RT-2 — модель «зір-мова-дія»: попередньо навчену на вебі модель зору й мови донавчили так, щоб дії робота вона видавала текстовими токенами. На небачених предметах і середовищах успіх зріс із 32% у RT-1 до 62% за понад 6000 випробувань.

Чому це важливо

Знання, яке доти існувало лише в тексті й зображеннях — що це за предмет і які предмети пасують один до одного, — дійшло до виходу, яким робот рухається, без того щоб хтось викладав ці поняття на роботі. Модель могла виконати вказівку про річ, якої ніколи не тримала.

Дії подано як текстові токени, тож модель зору й мови може їх породжувати тим самим механізмом, що й слова. На сценаріях із небаченими предметами, тлом і середовищем успіх зріс із 32% у RT-1 до 62%. Оцінювання охопило понад 6000 випробувань на роботі. На перевірках того, що автори назвали новоутвореними вміннями — розуміння символів, міркування й упізнавання людей — приріст проти базових моделей приблизно потрійний. На симуляційному тесті Language-Table модель дала 90% проти попередніх найкращих 77%. Допис і сторінка проєкту подають узагальнення дещо по-різному: допис пише про понад трикратний приріст, сторінка — про приблизно дворазовий у загальному узагальненні й трикратний саме на новоутворених уміннях; це різні зрізи оцінювання.

Відомості про подію

Дата події
28 липня 2023 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 20 вересня 2026 р.
Лінії
ID
evt-0439

Того самого дня подано першу версію на arXiv і опубліковано допис Google DeepMind.

Джерела

Пов’язані події

Записи, що посилаються на цей