В последние годы роботы успешно решали задачи на промышленных линиях — выполняли сварку, транспортировку и сборку в заранее определённых условиях. Но теперь перед ними стоят новые вызовы: им предстоит выйти в логистику, сферу услуг и быт. Для этого нужно научиться понимать окружающую среду, предсказывать изменения и решать новые задачи.
Развитие больших моделей открывает перед роботами новые горизонты. Языковые модели показывают способность обучаться на больших объёмах данных и обобщать знания между разными задачами. Однако роботы действуют в физическом мире, поэтому ключевой вопрос в области воплощённого интеллекта — как большие модели могут наделить роботов нужными способностями.
Сегодня основной вектор развития отрасли — VLA (роботы обучаются на данных о поведении людей, объединяя зрение, язык и действия). Но суть этого подхода остаётся в имитации прошлых действий. Возникает вопрос: смогут ли роботы обобщать знания, сталкиваясь с новыми задачами, опираясь только на имеющийся опыт?
Чэнь Цзяньюй, CEO компании «», на конференции WRC 2026 заявил, что модель мира может стать основной парадигмой следующего поколения воплощённого интеллекта. По его мнению, эволюция моделей зависит не только от объёма данных, но и от взаимодействия с реальным миром и получения обратной связи. Мозг, тело и среда развиваются совместно.
Универсальный робот должен обладать высоким уровнем свободы и интеллекта, а также высокой степенью универсальности и обобщающей способности — без необходимости заново разрабатывать аппаратное и программное обеспечение для новых задач. Для создания такого робота нужно одновременно разрабатывать его «мозг» и «тело», объединив их со средой в систему совместного развития.
Компания уже добилась прорывов в интеграции программного и аппаратного обеспечения. Среди достижений — разработка собственной модели управления движением и создание двуногого тела с гибкими руками. Система состоит из трёх уровней:
* верхний уровень — универсальный модельный комплекс (VLA, мирная модель, данные), способный адаптироваться к различным сценариям;
* средний уровень — «тело» (онтология), необходимое для взаимодействия с физическим миром;
* применение модели и «тела» в сценариях даёт данные для развития модели — формируется цикл эволюционного развития.
Существуют три парадигмы развития embodied AI:
1. Язык + управление роботом (начиная с ChatGPT). Здесь языковая модель усиливает рассуждения в роботах, при этом сохраняется модульная структура (восприятие, управление, исполнение). Уже проведено первое в мире академическое исследование по объединению большой языковой модели с антропоморфным роботом: языковая модель выступает верхним уровнем планирования, а нижний уровень основан на традиционных методах.
2. VLA на базе мультимодальных моделей (примерно с 2023 года, с появлением GPT‑4). Здесь визуальная информация и функции взаимодействия робота с средой интегрированы в единую модель. Примеры таких решений — PaLM и RT от Google. В 2024 году были опубликованы работы по этой парадигме.
3. Мирная модель (world model). Она позволяет прогнозировать будущие действия и эволюцию состояния мира, формируя замкнутый цикл. Пример в области AI — Sora (2024), также развивается Seedance.
У VLA есть ограничение: он опирается на имитацию, поэтому требуется сбор большого объёма данных о действиях людей, что ограничивает обобщение в новых сценариях. В свою очередь, мирное моделирование даёт общее понимание физических законов (здравый смысл), что улучшает обобщение — например, робот понимает, что вода при выливании будет течь вниз.
В 2024 году была представлена первая в мире модель мирового действия, которая объединяет видеопрогноз и прогноз действий. Она стала стандартом для таких моделей, опередив решения NVIDIA примерно на год. В начале 2025 года опубликована статья о сочетании набора данных на основе масштабных данных о человеческом поведении с моделью мирового действия. Набор включает данные с реальных роботов и данные о действиях человека от первого лица.
Компания также сотрудничала с командой Facebook* AI (FAIR) и Andreas над ControlNet — это повысило точность и управляемость действий. Модель демонстрирует высокую способность к моделированию и прогнозированию: сгенерированные ею изображения почти неотличимы от реальных снимков (например, моделируются складки полотенца или извлечение листа бумаги).
Модель способна выполнять задачи с нулевым примером — то есть справляться с новыми задачами без предварительного обучения. Примеры таких задач: «положи левую тапочку рядом с правой», «подними второй стакан», «возьми изоленту из кучи предметов и расположи её вертикально». После дополнительной тренировки модель выполняет тонкие манипуляции: складывает коробки, выворачивает носки, снимает обувь, включает воду. Она также обладает межобъектными возможностями — может управлять сложными манипуляторами и использовать инструменты (например, забивать винты шуруповёртом или управлять пипеткой).
Компания ведёт полную собственную разработку компонентов для человекоподобного робота — от корпуса и суставных модулей до механических рук, двигателей, редукторов, драйверов и алгоритмов управления движением. Цель разработки онтологии — дать роботу способность входить в реальный физический мир и выполнять разнообразные задачи, а не только отдельные действия.
Произошёл переход от традиционного механического проектирования человекоподобных роботов к обучению и управлению всей системой с более высокой степенью свободы. В 2023 году реализован первый в мире коммерческий комплекс для человекоподобного робота по перемещению по сложной местности — робот может ходить по воде, подниматься и спускаться по лестницам. Во время китайского Нового года была продемонстрирована способность полноразмерного человекоподобного робота выполнять танец с мечом.
«Лапки-манипуляторы» — важный тип концевых исполнительных механизмов. В отличие от традиционных зажимов и присосок с одним уровнем свободы, они способны выполнять сложные манипуляции, подобно человеческой руке. Данные для обучения манипуляторов берутся из данных о поведении людей. Три основных технологических направления в разработке «лапок-манипуляторов»: рычажный привод, тросовый привод и прямой привод. Компания первой в отрасли выпустила продукт с прямым приводом для «лапок-манипуляторов»: скорость отклика — 10 кликов по мыши в секунду, нагрузка — 24 кг, высокая устойчивость и ударопрочность.
Стратегия компании — одновременная разработка ПО и аппаратного обеспечения для создания целостного продукта и решения для конечных пользователей. Начата работа с логистической отраслью, в дальнейшем планируется расширение на сферу услуг, потребительский и домашний сегменты. Открыта аппаратная платформа, набор программных инструментов и API для разработчиков и исследователей.
С этого года отрасль воплощённых систем вступает в этап коммерциализации: проекты для B-клиентов охватывают более десяти городов, роботы регулярно используются в логистике. Используется универсальная модель «end-to-end большая модель + человекоподобный робот + манипулятор» для постепенного освоения специализированных сценариев.
Универсальный робот — это не отдельный продукт, а эволюционирующая система: по мере развития возможностей системы открываются новые сценарии применения. Упоминается WRC 2026 и создание группы для участников WRC 2026. Конференц-информационный центр предоставляет уведомления о дедлайнах подачи материалов, требованиях к формату, ходе рецензирования. Есть сообщество коллег для обмена опытом и налаживания связей. Доступны обновления по передовым исследованиям и актуальным направлениям. В период конференции доступна поддержка на месте: навигация по площадке, обсуждение тем воркшопов и Keynote, сбор материалов постеров, организация встреч и общения. Для присоединения к группе нужно отсканировать QR-код или добавить в WeChat Qvv0909777 с комментарием: WRC + учреждение/вуз + фамилия + направление. Доступ к материалам: презентации экспертов, полные тексты докладов, разборы популярных статей, интервью с начинающими учёными. :WRC:
* Meta Platforms Inc. признана экстремистской организацией, её деятельность запрещена на территории РФ.