Сюй Даньфэй из Технологического института Джорджии и NVIDIA в докладе «Compositional World Models» на RSS 2026 поднял важную проблему в сфере робототехники и моделей мира. Дело в том, что хотя современные модели вроде Sora способны создавать реалистичные будущие сцены, роботы зачастую не могут успешно выполнять задачи в реальном мире. Возникает разрыв между способностью генерировать результаты и умением планировать действия.
Роботы нередко оказываются в тупике при столкновении с длительными задачами и сложными физическими ограничениями: они могут «понимать» сцену, но не способны выполнить нужные действия. Сюй Даньфэй предложил решать эту проблему с помощью модульности и факторных графов (Factor Graphs). Суть подхода в том, что робот должен динамически собирать базовые навыки на этапе тестирования — подобно сборке конструктора.
В основе подхода лежат идеи Марвина Мински: сложную систему нужно разбивать на простые модульные компоненты, которые будут динамически комбинироваться на этапе тестирования. При этом важно, чтобы состояние, в котором завершается первый навык, точно соответствовало начальному состоянию для запуска второго навыка — это своего рода «соглашение» между навыками.
Традиционный линейный способ соединения навыков (Linear Chaining) отличается низкой эффективностью передачи информации. Чтобы решить эту проблему, используются факторные графы (Factor Graphs): они позволяют свободно задавать ограничения в пространственно‑временном измерении. Благодаря этому можно:
* точно задать относительное положение конца механической руки и объекта;
* обеспечить физическое синхронное перемещение объекта и механической руки;
* комбинировать модели одноруких роботов для выполнения задач, требующих координации двух рук — например, совместно поднять тяжёлую кастрюлю, передать молоток левой рукой и захватить его правой, чтобы ударить по гвоздю.
Существует проблема разрыва между видео и действиями: даже если модель предсказывает идеальное видео, действия робота могут не соответствовать прогнозу. Причина в том, что для видеомоделей доступно много визуальных данных, а для моделей управления роботами не хватает данных о действиях.
Для измерения этого разрыва предложен показатель Temporal Ratio — он демонстрирует, какой вес модель придаёт прогнозу будущего или текущему состоянию в процессе управления. Выяснилось, что на этапе приближения к цели (Reaching) Temporal Ratio высок (модель опирается на прогноз траектории), а на этапе физического контакта и захвата (Grasping) внимание переключается на текущее состояние. Чтобы повысить успешность выполнения сложных задач вне распределения (OOD), предложено использовать руководство по стратегии (Policy Guidance): усиливать внимание модели к прогнозу будущего при приближении к цели и переключать внимание на текущее состояние при контакте с объектом.
Ключевая задача для развития воплощённого интеллекта — определить на этапе тестирования, какие компоненты комбинировать (What to compose) и каким образом (How to compose). Когда действия робота точно соответствуют предсказанным визуальным сценариям, потенциал мировых моделей полностью раскрывается.
Также стоит обратить внимание на вопрос использования данных в обучении. Сейчас в исследованиях и практике в основном используются «успешные траектории» — эффективных планировщиков для обработки «неудачных видео» пока нет. Чтобы создать алгоритм, глубоко понимающий физические ограничения, нужно научиться предсказывать неудачи так же хорошо, как и успехи. Современные видеомодели обучаются на данных об успешных действиях людей, а примеров неудач в наборах данных мало. Если начать систематически собирать пограничные и неудачные траектории, это позволит существенно расширить границы безопасности мировых моделей.
Ещё один важный вопрос — объединение мировой модели (World Model) и модели стратегии (Policy). Авторы доклада считают, что их лучше сохранять разделёнными по нескольким причинам:
* модели всё ещё находятся в состоянии сильного недообучения (Underfitting), их ёмкость не исчерпана при работе с огромными наборами видео‑ и сенсомоторных данных из интернета; добавление цели управления Policy усложнит сходимость предварительного обучения;
* у моделей разные способы использования данных: цель Policy — выдавать точные управляющие команды, она предпочитает высококачественные успешные данные (подходит для SFT или тонкой настройки в обучении с подкреплением); мировая модель должна обрабатывать большие объёмы неудачных и аномальных данных для формирования полного представления о физическом мире.
Разделение и раздельная оптимизация моделей — более надёжный и эффективный подход.
Анонсируется RSS 2026, идёт набор исследователей в группу для отслеживания статей в реальном времени и обсуждения технологий. Для вступления нужно отсканировать QR‑код или добавить в Telegram/WeChat пользователя Luyoyo_2026, указав в заметке « + AI ».
:RSS:,