Gemini Robotics доходить до керування тілом
Google DeepMind оголосила Gemini Robotics — модель «зір-мова-дія» на основі Gemini 2.0 — і Gemini Robotics-ER для втіленого міркування, заявивши подвоєння показника на тесті узагальнення проти інших таких моделей.
Чому це важливо
Це момент, коли в передової лінійки моделей загального призначення з’явився вихід у дію, а не робототехнічна група позичила собі модель зору й мови. В атласі це також початок лінії, яку доти представляв лише Gemini Robotics 2 із липня 2026 року.
За заявою DeepMind, у середньому Gemini Robotics більш ніж удвічі поліпшує показник на комплексному тесті узагальнення проти інших передових моделей «зір-мова-дія», а Gemini Robotics-ER дає в 2-3 рази вищу частку успіху за Gemini 2.0 у наскрізному керуванні. Навчальні дані походять переважно з дворукої платформи ALOHA 2; модель також показано на дворуких руках Franka і на гуманоїді Apollo від Apptronik. Певність тут середня: тест названо комплексним тестом узагальнення без посилання на зовнішню незалежно проведену перевірку, і перелік моделей, з якими порівнювали, у дописі не розкрито.