Ли Фэйфэй и Илун Ду совместно работают над новым подходом к управлению роботами: вместо создания для них «большого мозга» предлагается использовать видеомодели. В статье Masked Visual Actions for Unified World Modeling, опубликованной в arXiv 6 августа 2026 года, представлен метод MVA (Masked Visual Actions). Среди авторов статьи — Ли Фэйфэй (создатель ImageNet), У Цзяцзюнь (ассистент профессора в Стэнфорде, специалист по физическому мышлению, лауреат награды IJCAI 2026), Чжан Люминь (автор ControlNet), Гордон Ветцштейн (руководитель лаборатории вычислительной визуализации в Стэнфорде), Хуан Вэньлун (ключевой сторонник базовых моделей роботов), Илун Ду (ассистент профессора в Гарварде) и другие.
Проблема существующих видеомоделей (Sora, , , и др.) в том, что они понимают физику, но не способны преобразовывать команды в сигналы для механизмов. Например, модель может спрогнозировать, что вода выльется из наклоняемого кувшина в чашку, но не умеет перемещать чашку влево. Суть проблемы — в отсутствии «интерфейса перевода»: язык видеомоделей («как движутся пиксели, как меняется цвет») не совпадает с языком роботов (сколько градусов повернулся сустав, на сколько сантиметров переместился конец манипулятора и т. д.).
Ранее исследователи пробовали разные способы преодолеть этот разрыв:
* UniPi использует текстовые подсказки для генерации видео, но точность действий ограничена размытостью словесных инструкций;
* Track2Act (совместная работа CMU и Meta*) отмечает точки траектории на изображении и предсказывает действия по ним, однако разреженные точки не передают непрерывность движения;
* Ctrl-World передаёт модели углы суставов робота, но решение хрупкое: для другого манипулятора те же команды («сустав 1 повернуть на 30 градусов») будут означать другую позу.
Метод MVA решает эту проблему, преобразуя действия в пиксельные маскированные траектории и выполняя как прямое (моделирование мира), так и обратное (генерация действий) преобразование. Работа метода состоит из трёх шагов:
1. Действие преобразуется в цветное видео с помощью SAM (Segment Anything Model, модель от Meta*). Модель сегментирует робота и объекты на видео, выделяя их области (mask) в каждом кадре. Эти области образуют траектории движения робота и объекта.
2. Одна из траекторий (например, движения объекта) скрывается, а траектория движения манипулятора остаётся видимой. Неполное видео передаётся в AI, который должен спрогнозировать дальнейшее развитие событий.
3. AI анализирует видимую траекторию (например, движение руки) и предсказывает, как будет двигаться скрытый объект. Либо, если скрыта траектория манипулятора, AI по движению объекта (например, скольжению чашки) должен восстановить действия манипулятора.
AI выступает в роли генератора действий: по заданному изменению мира он определяет, как должен действовать робот. Одна модель и одни параметры используются и для симуляции мира, и для генерации действий — выбор режима зависит от того, какой цвет скрыт.
Для обучения робота использовался открытый видеогенератор Wan2.2 от Alibaba. Модель имеет 140 млрд параметров, основана на архитектуре диффузионного Transformer и считается одной из лучших в открытом доступе. MVA применил LoRA (Low-Rank Adaptation) для адаптации Wan2.2 к распознаванию цветовых блоков в системе команд робота. Микронастройка на 15 часах данных позволила роботам переходить от управления одной рукой к управлению неизвестной ранее двойной рукой.
Результат MVA по метрике LPIPS (чем ниже значение, тем лучше) — 0,0945, у метода Ctrl-World — 0,362 (разница почти в 4 раза). MVA успешно сработал при смене типа робота: при обучении использовался однорукий робот, при тестировании — двурукий; Ctrl-World не справился, а MVA выдал достоверный прогноз.
Среди возможностей, продемонстрированных в статье, — оценка существующих стратегий (робот мысленно «проигрывает» варианты действий и выбирает лучший), использование в качестве планировщика (без обучения специального сетевого стратегического модуля, через многократное воображение и отбор) и обратный вывод действий (робот выводит, как должна действовать механическая рука для выполнения задачи).
Ключевой элемент подхода — URDF (Unified Robot Description Format), универсальный формат описания робота. Он содержит данные о количестве суставов, максимальных углах их поворота, длине звеньев и положении концевого эффектора. С помощью URDF решаются задачи прямой (FK) и обратной (IK) кинематики: FK — по углам суставов определяется положение концевого эффектора; IK — по желаемому положению концевого эффектора рассчитываются углы суставов. MVA сначала определяет целевое положение конца эффектора, затем с помощью URDF и IK рассчитывает необходимые углы суставов для конкретной машины. URDF также ограничивает возможности видеомодели, гарантируя, что сгенерированные позы физически реализуемы на конкретной машине — это повышает правдоподобие визуализаций.
Технический руководитель в сфере робототехники Ли Линьсинь (CTO компании WeiTJia Robotics, Шэньчжэнь) считает, что ключевая ценность статьи — в усилении обобщающей способности модели, а не в качестве её обучения. Ли Линьсинь отмечает различие между прямым и косвенным выводом в VLA-стратегиях: большинство стратегий для реального развёртывания выводят низкоуровневые представления действий, привязанные к конкретному объекту (углы суставов, приращения концевого эффектора, скорости суставов), что делает их неработоспособными на машинах с другой кинематической структурой. Команда Ли Линьсиня идёт по пути модели скрытого мира под влиянием Yann LeCun; ключевой момент в их подходе и в статье — импорт URDF и расчёт IK/FK.
В первой половине этого года в отрасли наблюдается тенденция разделения vision и action (видения и действия): часть «видение» обучается на огромных объёмах видео из интернета (данные в тысячи и десятки тысяч раз больше, чем данные с реальных роботов), часть «действие» — на относительно небольшом объёме данных роботов с дополнением кинематическими расчётами. Статья соответствует этой тенденции.
Идея метода MVA заключается в том, что развитие воплощённого ИИ может заключаться не в увеличении собственных моделей робота, а в использовании уже мощных визуальных больших моделей. Видео в интернете практически безгранично, а данные о реальных операциях роботов дефицитны и дороги.
* Meta Platforms Inc. признана экстремистской организацией, её деятельность запрещена на территории РФ.