19 июля на Всемирном конгрессе по ИИ провела мероприятие « ». А на WAIC 2026 состоялась официальная презентация серии моделей MiniCPM-Robot от . Компания совместно с OpenBMB выпустила и открыла исходный код двух моделей: MiniCPM-RobotManip и MiniCPM-RobotTrack.
MiniCPM-RobotManip — универсальная VLA-модель для управления роботами. Она основана на модели MiniCPM-V 4.6, имеет 1,5 млрд параметров. Производительность модели сопоставима с моделями объёмом 3–4 млрд параметров, при этом стоимость потоковых вычислений в реальном времени снижена вдвое. Модель поддерживает 1 минуту собственной памяти. Результаты на RMBench: 53 балла, π0.5 — 10 баллов. Задержка одного шага вывода на H100 (BF16) составляет 120 мс (у π0.5 — 234 мс).
Применение визуального Token для сжатия данных в робототехнике позволяет существенно снизить вычислительные затраты и задержки при обработке визуальных данных. Например, в задаче с 60 кадрами истории при традиционном подходе требуется 125 TFLOPs на шаг решения, а при потоковом выводе — всего 3,3 TFLOPs. Для сравнения: π0.5 при отсутствии истории требует 5,0 TFLOPs.
Вторая модель — MiniCPM-RobotTrack — разработана и Нанкинским университетом. Это первая модель отслеживания с возможностью локального развёртывания без сети. Она адаптирована под Unitree Go2 Edu, обеспечивает отслеживание целей со скоростью 5+ Гц, задержка отклика — около 180 мс. Модель имеет 0,9 млрд параметров и предназначена для отслеживания визуальных команд.
Результаты по отслеживанию у MiniCPM-RobotTrack впечатляют:
* 89,8 % при одноцелевом отслеживании (STT);
* 73,4 % при динамическом многоцелевом отслеживании (DT);
* 80,4 % при нечётком отслеживании целей (AT).
По сравнению с OmTrackVLA результаты выше на 7,0, 14,6 и 6,5 процентных пункта соответственно. По сравнению с TrackVLA++ в одноцелевом и нечётком отслеживании результаты выше на 8,8 и 17,0 процентных пункта, успешность в нечётком отслеживании — 58,0 %.
MiniCPM-RobotTrack использует саморазвивающуюся систему обработки данных: очищает данные от аномалий и ошибок, применяет стратегию DAgger для выявления слабых мест модели, дополняет данные в сложных сценариях (быстрое изменение направления, кратковременное перекрытие, взаимодействие нескольких людей). Модель способна работать без подключения к сети, выполняя распознавание целей, отслеживание и управление движением на основе локальных визуальных данных и текстовых команд. Её можно использовать для патрулирования зданий, сопровождения людей, обеспечения безопасности в парках, а в будущем — в спасательных операциях, специальных задачах в условиях слабого или отключённого интернета или сильных помех. Будет предоставлен полный процесс развёртывания и скрипт для однократного запуска.
Обе модели поддерживаются фреймворком PhyAI — открытым фреймворком для Physical AI. Он предназначен для быстрого вывода на устройстве и масштабного вывода RL в облаке. На NVIDIA GeForce RTX 5090 PhyAI обеспечивает ускорение для π0 (в 2,85 раза), π0.5 (в 1,82 раза), GR00T (в 2,28 раза). Для GR00T на NVIDIA Thor и A40 ускорение составляет 1,40 и 4,31 раза соответственно. С помощью CUDA Graph фреймворк увеличил частоту вывода с 10,12 Гц до 33,28 Гц. Применён метод слияния операторов: с помощью triton созданы специализированные операторы для MiniCPMRobot (RMSNorm+SiLU gate, conv1d+SiLU+QKV split), частота вывода на NVIDIA H20 достигла 36,77 Гц.
FaceBionic сотрудничает с Leju Robotics над решениями для экскурсий по выставочным залам и патрулирования территорий. Также ведётся сотрудничество с Geely Auto по направлению VLA-модели и применению в складских производствах. Планируется дальнейшее развитие в сфере воплощённого ИИ через открытые технологии и промышленное партнёрство.
Ссылки на ресурсы:
* Github:
* Hugging Face:
:WAIC: