DeepDigest
TechOrange · · ~2 мин

Google DeepMind представила Gemini Robotics 2 для управления человекоподобными роботами

Google DeepMind выпустила модель Gemini Robotics 2, способную управлять полноценным человекоподобным роботом через единую VLA-стратегию. В релиз вошли три модели с разными функциями — от управления движениями до высокоуровневого рассуждения. Несмотря на значительные успехи, эффективность выполнения сложных задач пока остаётся неравномерной.

Google DeepMind представила Gemini Robotics 2 для управления человекоподобными роботами

Google DeepMind 30 июля представила новую версию модели Gemini Robotics 2. В отличие от предыдущей версии, которая могла управлять только одной роботизированной рукой, новая модель способна управлять целым человекоподобным роботом: например, подвести его к столу, наклониться к нижней полке и поместить кувшин для воды в нижний зелёный ящик. В демонстрации использовалась модель робота Apollo 2 от Apptronik.

Ключевое новшество Gemini Robotics 2 — единая стратегия vision-language-action (VLA), которая объединяет ранее разрозненные функции управления движением и действиями. Это позволяет обучать модель новым действиям, требующим координации всего тела, и обновлять возможности робота через программное обеспечение.

В рамках релиза представлены три модели:
- Gemini Robotics 2 — VLA-модель, которая преобразует изображения и языковые команды в управление моторами. Это первый в DeepMind VLA-модель для управления полноценным человекоподобным роботом.
- Gemini Robotics ER 2 — модель «мозга» робота: она принимает естественные языковые команды, планирует многоэтапные задачи, контролирует выполнение и при необходимости обращается за помощью к человеку. Модель может одновременно планировать следующие шаги и выполнять текущие действия — без пауз «на размышление».
- Gemini Robotics On-Device 2 — версия для локального офлайн-выполнения. Использует технологию «переноса движений» из предыдущей версии и может адаптироваться к новому типу робота за несколько часов, используя менее 200 примеров.

Google DeepMind подчёркивает, что для помощи человеку в повседневных условиях роботу нужно не только точно рассуждать о пространстве, но и быстро принимать решения — в темпе реального времени.

Для обеспечения безопасности Google разработала новый стандарт оценки безопасности роботов — ASIMOV-Agentic. Он позволяет выявлять команды, которые могут привести к опасным или неопределённым результатам. По словам главы подразделения робототехники Google DeepMind Каролины Парада, в модели внедрены многоуровневые меры безопасности.

Тем не менее, модель ещё далека от повсеместного применения. Согласно данным Tech Times, успешность выполнения задач варьируется: для захвата объектов на столе — 68,4 %, на полу — 45,7 %; для поворота лампочки — 92 %, для завязывания мусорного пакета — около 44 %, для выполнения самой сложной задачи — всего 32 %.

Данные для обучения модели поступают из Robot Park в Остине (Техас), где робот Apollo 2 непрерывно работает и генерирует данные из реального мира. По мнению Tech Times, такой подход — ключ к масштабированию физического ИИ: единое ПО, данные от аппаратного партнёра и обновления модели для наращивания новых возможностей.

// оригинал
TechOrange ↗ Читать оригинал
7 просмотров
// поделиться Telegram VK