Мовна модель планує дії робота
SayCan поєднала пропозицію мовної моделі про те, що робити, з оцінкою вивченої функції цінності про те, що робот насправді може зробити зараз; на 101 задачі, заданій природною мовою, це дало 84% успішних планів і 74% успішних виконань.
Чому це важливо
Мовну модель приєднали до робота, не вдаючи, ніби вона щось знає про тіло: функція цінності накладала вето на кроки, яких робот виконати не може. Саме цей поділ — планувальник згори, перевірка можливого знизу — згодом моделі «зір-мова-дія» згорнули в одну мережу.
Роботу зробили Google і Everyday Robots, запускали на мобільному маніпуляторі в офісній кухні. Оцінювання охоплювало 101 задачу, задану природномовними вказівками. Показники 84% для плану і 74% для виконання опубліковано разом із оновленням PaLM-SayCan 16 серпня 2022 року; на сторінці проєкту сказано, що це на 14 і 13 пунктів вище за першу версію, подану 4 квітня 2022 року. Тобто квітневий випуск давав приблизно на стільки ж менше, і приписувати квітневій даті серпневі числа не можна. Суть методу в тому, що мовна модель ранжує можливі наступні кроки за корисністю для вказівки, а функція цінності — за досяжністю в поточному стані, і обирається крок, добрий за обома мірками.