В июле 2026 года в Сиднее на конференции RSS прошёл workshop «Robot World Models». Участники обсуждали переход от подхода «пиксельный режиссёр» к концепции «воплощённый мозг»: от идеи, что интеллект формируется за счёт большого объёма данных, к использованию «воображения» в ИИ. Ранее формула успеха в ИИ выглядела так: большое количество параметров плюс огромный объём интернет‑данных = появление интеллекта. Такой подход хорошо работал для текста, изображений и видео, но столкнулся с ограничениями в физическом мире — так называемой «физической стеной». Действия роботов ограничены временем и пространством, поэтому возникла потребность в новом подходе.
На workshop достигнут консенсус: мир‑модели (World Model) должны стать «логическим центром» и «виртуальной песочницей» для роботов, а не просто генераторами видео. Задача — научить роботов не заучивать действия, а применять логику по принципу «от одного к многим», то есть предвидеть и оценивать последствия действий в виртуальном пространстве. Например, робот должен уметь определить, разобьётся ли стакан при движении руки или обрушится ли пространство за дверью при её открытии.
Выступления на первой части workshop отражают сдвиг в сфере воплощённого ИИ: от исследований нулевой обобщающей способности команды Pi до защиты композиционной логики в OpenDrive Lab и перестройки мультимодальной основы в Nvidia.
Команда Pi продемонстрировала, как мир‑модель может предоставлять «целевое изображение» (Goal Image), а не просто создавать фильмы. В эксперименте робот, который никогда не учился управлять воздушной фритюрницей, смог выполнить задачу после просмотра видео с человеком, готовящим картофель фри, без данных телеуправления (Teleop Data). Робот «додумывает» визуальное завершение задачи через мир‑модель, комбинируя человеческие знания из видео (например, как открывать ящики, помещать предметы) с базовыми навыками (захват, перемещение) через «логическую интерполяцию». Через кросс‑телесность (Cross‑embodiment) команда Pi перенесла навык складывания одежды с одного робота на UR5. По словам Laura Smith из команды Pi, визуальное рассуждение (Visual Reasoning) даёт роботам способ обучения без конкретных меток действий, а «воображение» становится инструментом для выполнения сложных задач и снижения зависимости от данных.
Чэнь Ли из OpenDrive Lab предложил композиционные мир‑модели (Compositional World Models) в рамках RISE. В такой модели мир‑модель разделена на динамический компонент (отвечает за «представление будущего») и ценностный компонент (оценивает, безопасны ли будущие сценарии и соответствуют ли целям задачи). Это повышает безопасность и эффективность использования данных: в виртуальном пространстве робот может многократно моделировать «пути неудачи» и учиться соблюдать физические законы.
Макс Ли из Nvidia представил Cosmos 3 — первый глобальный мультимодальный базовый мир‑модель в единой архитектуре Transformer (MoE). Модель объединяет текст, зрение, аудио и действия, унифицируя семантику действий для разных устройств (автомобили, одно‑ и двурукие роботы, человекоподобные роботы) через общий протокол «мозг и конечности». Cosmos 3 претендует на роль «Android‑системы» в эпоху воплощённого интеллекта. Модель использует взаимодействие «инференс‑движка» («») и «генератора» («») для сочетания обратного динамического вывода и механизма перехода состояний.
NVIDIA выпускает несколько версий модели: Cosmos Edge (4B) для локального инференса на устройствах типа Jetson, а также модели Super (64B) и Nano (16B) для серверов. Все модели, код и статьи Cosmos 3 открыты.
Кроме того, Interactive World Simulator поддерживает стабильное видеопрогнозирование более 10 минут (15 FPS). Показана возможность обучения робота без реальных данных и его работа в реальных условиях (работа с верёвкой, захват чашки). Также предложено использовать акустические датчики (микрофоны) вместо визуальных сенсоров для адаптивного управления у человекоподобных роботов: с помощью отражения звука в полостях можно определять столкновения и давление.
Таким образом, 2026 год становится поворотным моментом в развитии робототехники — происходит переход от заучивания действий к способности к обобщению и прогнозированию. :RSS:,