Лаборатория Huawei Noah’s Ark представила систему RoboHarness — она призвана решить проблему отсутствия взаимодействия между разными стратегиями в робототехнике. Система использует стратегию оркестровки гетерогенных подходов, чтобы обеспечить совместную работу VLA (визуально-языково-действенной модели), WAM (модели «мир-действие»), RL-стратегий (обучения с подкреплением) и TAMP (планирования задач и движений). Это позволяет выполнять длительные последовательные задачи без примеров (с нулевым количеством примеров).
Задача для робота, например, открыть дверцу шкафа, найти в нём кубики и построить из них мост, требует разных способностей: визуального понимания, следования языковым инструкциям, сложного взаимодействия с окружающей средой, геометрического планирования, точного управления и прогнозирования изменений среды. Различные способности реализуются разными моделями, которые различаются методами обучения, форматом входных данных и пространством состояний.
RoboHarness объединяет существующие модели в единую систему через агентские навыки (agentic skills), управляемые Coding Agent. При этом исходные стратегии не переобучаются и сохраняют свои реализации — модели не делят структуру, пространство действий или данные обучения.
Coding Agent не может надёжно выбрать стратегию только на основе исходных изображений — нужны дополнительные данные. Для решения проблемы в системе есть три типа вспомогательных навыков:
* Understanding Skills — преобразуют входные данные в количественные сигналы (например, сходство эмбеддингов изображений с данными обучения стратегий, стабильность позы объектов, качество освещения и изображения);
* Memory Skills — ищут исторический опыт выполнения задач и через Memory Bridge решают проблему несовпадения распределений состояний между стратегиями;
* Evolution Skills — на основе онлайн‑обратной связи обновляют метаданные стратегий и логику оркестровки, позволяя системе учиться на каждом выполнении задачи.
Memory Bridge — ключевой модуль в RoboHarness для стабильного перехода между стратегиями. Его работа включает три шага:
1. Поиск: из мультимодальной базы данных извлекаются Top-K схожих траекторий выполнения стратегии на основе текстового и визуального сходства, извлекаются данные о положении исполнительного механизма, углах суставов и других состояниях робота.
2. Моделирование: на основе относительного положения состояний в траектории присваивается сигнал контроля, с помощью онлайн‑регрессии определяется диапазон состояний, приемлемый для стратегии.
3. Соединение: отбирается оптимальный целевой показатель перехода путём оценки уверенности в попадании в комфортную зону стратегии и стоимости движения, генерируется траектория перехода.
Механизм опирается на онлайн‑обучение на основе исторических данных, совместим с любыми стратегиями без изменения базовой реализации и совместного обучения. При удалении Memory Bridge из эксперимента прогресс выполнения задач почти не изменился, но общая успешность упала с 86,0 % до 60,4 % — это подтверждает важность Memory Bridge.
Идея RoboHarness возникла после участия в соревновании BEHAVIOR Challenge: тогда команда убедилась, что ни VLA, ни модели на основе имитации поведения не справляются с комплексными и длительными задачами. Механизм имеет две функции: разбиение длинных инструкций на подзадачи и динамический переход между стратегиями при приближении к пределу их возможностей. Эксперименты показали: при разбиении задачи с помощью языковой модели pi0.5 успешность выполнения возрастает; при добавлении нескольких гетерогенных стратегий успешность повышается ещё сильнее.
Команда профессора Юйчао из Университета Цинхуа в июле выпустила Harness VLA. С помощью Harness Layer она позволяет замороженной VLA сосредоточиться на плотном контакте‑управлении, а слой Harness определяет, когда и как вызывать VLA, как перезапускать и повторять действия после её сбоя. В оценке LIBERO-Pro система повысила успешность с 50 % до 82,4 %.
Harness VLA решает задачу стабильности модели при внешних возмущениях, а RoboHarness — задачу выполнения задач, выходящих за пределы возможностей отдельной модели. Обе системы используют Coding Agent в качестве организационного слоя, но решают разные задачи.
За последние три года VLA развивалась быстро, из‑за чего традиционные TAMP и иерархическое планирование утратили внимание сообщества из‑за меньшей обобщающей способности в открытых сценариях. Однако с развитием agentic systems и coding agents иерархические архитектуры обрели новую жизнь: верхний агент может использовать комбинируемые навыки для разбиения задач, вызова инструментов и динамического планирования, что улучшает обобщающую способность и адаптивность традиционных методов. Сообщество вновь изучает, как сочетать обобщающее верхнее рассуждение с гетерогенными нижними стратегиями.
В Северной Америке существуют две технологические линии в исследованиях робототехники:
* Западное побережье (Stanford, Berkeley) акцентирует обучение и масштабирование — эндо-то-эндо обучение, масштаб данных и обобщение моделей;
* Северо-восток США и Канада (MIT, Университет Торонто, MILA) — иерархическую архитектуру, символьные рассуждения, логическое планирование и структурированные решения.
Формируется технологический спектр от масштабирования базовых моделей до агентной иерархии: одни команды фокусируются на универсальных базовых моделях, VLA и моделях мира, расширяя границы обобщения; другие — на повторно используемых навыках и иерархической архитектуре, выполняя сложные задачи через планирование, комбинацию навыков и нижнее управление.
В Китае команда Zhiyuan ближе к первой линии, Suodu Technology и Magic Atom — ко второй; за рубежом Physical Intelligence (серия pi) представляет линию масштабирования, Gemini Robotics — линию иерархического подхода (верхний уровень — рассуждения и планирование, нижний — выполнение навыков).
Две технологические линии эволюционируют и дополняют друг друга: например, Physical Intelligence в pi0.7 выдвигает на первый план управляемость и комбинацию навыков; NVIDIA и другие команды выпускают агентные системы роботов с иерархическими характеристиками, объединяя понимание и рассуждения базовых моделей с VLA.
RoboHarness имеет ограничения: он может планировать только существующие стратегии и не решает задачи, которые не под силу никаким стратегиям; надёжность Memory Bridge зависит от достаточного объёма исторических данных выполнения, оценка способностей новых стратегий на ранних этапах имеет высокую неопределённость.
Авторы подчёркивают, что планирование долгосрочных задач не только комбинирует существующие способности, но и генерирует данные о межфункциональном и межсценарном выполнении, которые могут стать важным источником для обучения следующего поколения универсальных моделей роботов. Команда RoboHarness исследует возможность повторного использования данных, полученных в процессе выполнения смешанных стратегий, для обучения нижних стратегий; опыт выполнения гетерогенного планирования дополнительно улучшает базовые способности модели.
Конкуренция в области воплощённого интеллекта переходит на уровень проектирования систем: гетерогенное планирование стратегий и универсальные большие модели ведут к общей цели — обеспечить роботам более универсальный и надёжный интеллект.
Ссылка на статью:
Страница проекта:
<<<CODE_BLOCK_N>>>
<<<IMG_N>>>