DeepDigest
Leiphone · · ~4 мин

World Gym: видеомодель мира от Google для обучения роботов

Учёные Google разработали видеомодель мира World Gym для обучения роботов в облачной среде. Модель позволяет проводить низкозатратные тренировки, стандартизировать оценку стратегий и преодолевать ограничения физического мира. В тестах модель показала хорошие результаты и превзошла другие подходы.

World Gym: видеомодель мира от Google для обучения роботов

В сфере робототехники существует серьёзная проблема — высокая стоимость взаимодействия и проб в физическом мире тормозит развитие искусственного общего интеллекта (AGI). Учёные из Google нашли способ обойти это ограничение: они используют видеомодель мира, чтобы роботы могли тренироваться в облачной виртуальной среде. Такой подход позволяет проводить бесконечные низкозатратные тренировки.

Sherry Yang из лаборатории Google и NYU представила на конференции RSS 2026 подход, в основе которого — использование контролируемых моделей генерации видео как «заменителя» реального мира. Идея заключается в создании «модели мира» (World Model), которая сможет заменить реальный мир для обучения роботов. После того как модель будет успешно обучена, можно будет проводить множество симуляций в облаке. Для совершенствования модели до уровня супер-агента будет применяться обучение с подкреплением.

Для реализации этой идеи разработан World Gym — облачный симулятор. Для его работы достаточно двух карт A100. World Gym представляет собой модель для генерации видео на основе Transformer (DiT). Она сохраняет все измерения исходных движений роботов: принимает предыдущие изображения и текущие команды, а затем генерирует будущие кадры. Для обучения модели использовали 2 A100 GPU и данные из Bridge‑датасета. Обучение проводилось на датасете, включающем 22 вида роботов. Сгенерированные моделью видео демонстрируют высокую согласованность с реальными действиями роботов.

Одна из ключевых проблем при оценке стратегий в реальности — это большие временные затраты, риск повреждения оборудования и невозможность стандартизировать и воспроизвести результаты из‑за различий в оборудовании разных лабораторий. World Gym призван решить эти проблемы, выступая в качестве стандартизированного уровня оценки для моделей стратегий (Octo, OpenVLA, RT‑1).

В тесте на задачу «положить баклажан в кастрюлю» OpenVLA успешно справился, Octo выполнил действие наполовину, а RT‑1 вызвал сбой модели из‑за выхода за пределы распределения (OOD). Модель также позволяет проводить тесты OOD с помощью редактирования изображений. Например, если добавить экран с изображением моркови и дать команду «вытащить морковь», можно увидеть, насколько эффективна (или неэффективна) стратегия. Кроме того, выявлены проблемы с пониманием «команд по форме» по сравнению с «командами по цвету». Результаты оценки модели хорошо коррелируют с реальными измерениями успешности на физическом оборудовании.

Ещё один проект — World Gymnast — позволяет роботам обучаться в модели через RL. Роботы используют любые кадры из датасета как начальные точки, в том числе кадры с неудачными действиями. Это помогает им научиться восстанавливаться после ошибок (Failure Recovery).

В процессе обучения также задействована VLM (визуально‑языковая модель) в качестве Reward Model. Она получает на вход задачу и видео, сгенерированное мировой моделью, и выдаёт обратную связь (успех/неуспех). Обратная связь через Policy Gradient напрямую обновляет стратегию сети. Проведены тесты на 4 новых задачах (открывание/закрывание дверей, размещение помидора) с использованием автоматизированной платформы сброса. Модель, прошедшая обучение с подкреплением в мировой модели, превзошла модели с контролируемой дообучкой и модели, обученные в традиционных симуляторах (например, Simpler).

Мировая модель обладает сильной способностью к моделированию контактной динамики благодаря обучению на больших данных. Будущее развития AGI, по мнению разработчиков, связано с созданием смешанного «цикла данных»:
* внутренний цикл — стратегия в параметризованной видеомировой модели выполняет тысячи виртуальных задач с низким уровнем затрат на обучение с подкреплением;
* внешний цикл — робот самостоятельно исследует среду и генерирует данные об ошибках, которые используются для обновления мировой модели.

Человеческие видео с первого лица могут быть преобразованы в априорные знания для роботов. При тестировании RT‑1 модель вызвала серьёзные галлюцинации в мировой модели из‑за действий, выходящих за пределы распределения. Чтобы решить проблему «тупика» (deadlock), предлагается использовать данные об ошибках с реального робота для обновления мировой модели: сначала модель адаптируется к новому распределению, затем начинает корректно направлять стратегию.

Sherry Yang также рассказала, что два A100 позволяют проводить облачные тренировки, благодаря чему роботы могут самостоятельно восстанавливаться после неудач. :RSS:,

Исследователям ИИ предложили присоединиться к группе — через QR‑код или добавление в WeChat Luyoyo_2026 с комментарием « + AI ». Также есть доступ к материалам мировых конференций по ИИ: выступлениям экспертов, полным текстам докладов, разбору популярных статей, интервью с восходящими звёздами науки. Для доступа нужно отсканировать QR‑код или нажать «», а затем подписаться на раздел.

// оригинал
Leiphone ↗ Читать оригинал
3 просмотров
// поделиться Telegram VK