DeepDigest
Leiphone · · ~6 мин

Прорыв в воплощённом ИИ: решения на IJCAI 2026

На IJCAI 2026 представлены значимые достижения в области воплощённого интеллекта. Китайские учёные демонстрируют физико-инженерный подход к развитию ИИ, предлагая решения для навигации, захвата объектов и управления беспилотниками в сложных условиях. Разработки, такие как RepSAM и PECHC, демонстрируют высокую эффективность в нестандартных ситуациях.

Прорыв в воплощённом ИИ: решения на IJCAI 2026

На конференции IJCAI 2026 представлены ключевые достижения в области воплощённого интеллекта. Китайская научная группа делает ставку на физико-инженерные решения, отказываясь от идеализированных симуляций. За последний год развитие этой сферы заметно ускорилось: появились такие разработки, как π₀ от Physical Intelligence, OpenVLA в открытом сообществе. VLA-модели демонстрируют в тестах и демо-лабораториях успешность на уровне 90–95 % и выше.

Однако у больших моделей с миллиардами параметров есть серьёзные ограничения. Эксперименты показывают, что при изменении положения предметов или комбинации новых команд модели сталкиваются с проблемой «пространственной переобученности» — успешность выполнения задач резко падает. Например, в исследовании Ли Цюаньи (Oxa, старший научный сотрудник по прикладным наукам) выявлено, что VLA-модели механически ориентируются на фиксированные координаты из обучающих данных. Если в обучении сыр всегда был слева, модель будет тянуться влево даже при перемещении сыра вправо.

В стандартных тестах π₀, OpenVLA и UniVLA показывают успешность выше 95 %, но на 20 новых задачах в бенчмарке libero-ood результаты резко падают: OpenVLA — 1 %, π₀-fast — 17 %, UniVLA — 21 %. Ли Цюаньи с помощью методов объяснимой механики извлёк из большой модели «текстовые скрытые переменные», представляющие семантику задачи. После применения «вставки текстовых скрытых переменных» (TLI) в остаточном потоке модели без повторного обучения успешность выполнения новой задачи поднялась с 9 % до 83 %. Подробнее об этом можно узнать в статье «VLAs Are Confined yet Capable of Generalizing to Novel Tasks» (https://arxiv.org/pdf/2505.03500v5).

Другой значимый результат — схема адаптации RepSAM от Chu Wenhui (Университет штата Техас A&M). В работе «RepSAM: Bridging Foundation Models to Robotic Vision via Representation-Guided Adaptation» (https://arxiv.org/pdf/2605.25495) описана методика, требующая настройки всего 4 млн параметров. Обучение на одной карте A100 занимает 4 часа, при этом объём параметров сокращён в 158 раз, скорость обучения увеличена в 96 раз, качество восприятия достигло 97,9 % от уровня полного дообучения.

Chu Wenhui использовал теорию CKA для сканирования 32 слоёв Transformer в SAM и выявил закономерности смещения представлений:
* для поверхностных слоёв (L1–10) с резкими различиями в низкоуровневых характеристиках (CKA < 0,5) требуется высокая ёмкость адаптации (Rank 16);
* для средних слоёв (L11–22) — средняя ёмкость (Rank 8);
* для глубоких слоёв (L23–32) с высокоуровневыми семантическими представлениями (CKA > 0,7) достаточно низкой ёмкости адаптации (Rank 4).

RepSAM демонстрирует высокую способность к восприятию в сложных условиях (прозрачные стеклянные стаканы, сильно перекрытые детали). На задаче сегментации прозрачных объектов ClearGrasp mIoU вырос с 34,7 % (SAM с нулевым образцом) до 90,1 %. В физическом моделировании захвата PyBullet успешность захвата достигла 94,4 %, частота столкновений снизилась на 8,8 %. На встраиваемом устройстве Jetson AGX Orin RepSAM обеспечивает задержку отклика 63 мс (15,8 FPS).

Команда китайских исследователей (Chuangye Hu, Lulu Liu, Huaiwei Si, Yawen Zhao, Nan Ding) разработала фреймворк FILD-Nav (на основе статьи «FILD-Nav: Vision-and-Language Navigation with Instruction Landmark Features in Continuous Environments»). Алгоритм извлекает из команд ключевые признаки‑ориентиры (Instruction Landmark Features) и интегрирует их в процесс навигации:
* включает семантику ориентиров в генерацию точек маршрута — повышается соответствие между предсказанными точками маршрута и реальными ориентирами;
* применяет семантическую проверку ориентиров в мультимодальном планировании — улучшается способность к долгосрочной навигации.

В тестах на наборе данных VLN-CE:
* успех навигации (SR) вырос на 2 %;
* взвешенный по длине пути успех (SPL) вырос на 3 %;
* успех в незнакомых средах (OSR) вырос на 7 %.

Команда профессора Дун Эрбао (Китайский университет науки и техники) представила подход PECHC (статья «PECHC: Robust Tactile Grasping Stabilization in Vision-Denied Peripersonal Space») для работы в условиях отсутствия визуального ввода. Алгоритм передаёт контроль тактильным ощущениям в ближней слепой зоне. В нём применяются:
* смешанная коррекция имитационного обучения (HCIL) — механизм коррекции человек‑машина, запускаемый при сбое, требует минимального участия эксперта;
* каскадное планирование ограничений (CCS) — наложение физически обоснованных ограничений (геометрическое приближение, силовое замыкание, динамическая стабильность);
* временное гетерогенное дистилляция (THED) — неявное распознавание системы на основе исторических тактильных последовательностей.

В тесте с 150 реальными объектами (набор данных Visual Dexterity) алгоритм PECHC показал успех в 97,3 % случаев. Для 1 объекта потребовалась однократная калибровка HCIL, остальные 149 объектов были успешно обработаны без вмешательства. По сравнению с традиционным подходом Sim-to-Real (Vanilla PPO с рандомизацией домена) производительность PECHC повысилась на 42,8 %. Алгоритм демонстрирует тонкую регулировку силы при захвате хрупких предметов, схожую с человеческими возможностями.

Команда профессора Сюн Хуэй из Гонконгского технологического университета (Гуанчжоу) разработала алгоритм DRIQN (распределённая робастная неявная квантильная сеть) для защиты обучения с подкреплением от сложных помех. В алгоритме применены:
* моделирование явных подгрупп в буфере воспроизведения (данные разделяются на J подгрупп по паттернам шума);
* механизм «замены градиента» на основе распределённой робастной оптимизации (DRO) — он заменяет градиенты обратного распространения в последнем слое нейронной сети.

В условиях симуляции с 4 водоворотами, 6 случайными скальными препятствиями и сильным сенсорным шумом DRIQN показал высокую устойчивость: повысил коэффициент успешного наведения на 13,51 %, снизил частоту столкновений на 12,28 %, сэкономил 35,46 % времени и 27,99 % энергии в успешных рейсах. При комплексных сбоях (сбой датчиков и потеря данных) алгоритм достиг 58 % максимального коэффициента успеха и минимальной задержки. Подробнее в статье (https://arxiv.org/pdf/2512.00030).

Команда Гу Фуцяна из Чунцинского университета разработала архитектуру Disturbance-Aware Hybrid Learning для управления БПЛА в экстремальных ветровых условиях. Система включает модуль мгновенного распознавания ветровых помех, который оценивает нелинейные аэродинамические возмущения в режиме реального времени. Алгоритм комбинирует традиционную аэродинамическую модель и стратегию обучения с подкреплением, динамически регулируя вес управления в зависимости от интенсивности помех. Это позволяет БПЛА сохранять стабильное зависание и точно следовать траектории в экстремальных ветровых условиях.

Существуют два основных подхода к развитию ИИ:
1. Подход компаний типа Physical Intelligence и Figure — масштабирование больших языковых моделей (Scaling Law), увеличение параметров модели и объёма видеоданных для достижения универсального физического контроля.
2. «Физический инженерный» подход китайских учёных и исследовательских учреждений — анализ внутренней структуры больших моделей, использование теории CKA для выявления смещения представлений, встраивание визуальных больших моделей в краевые чипы при использовании всего 0,63 % параметров.

В сложных условиях (потеря чёткости изображения, воздействие волн и сильного ветра) применяются мгновенные сенсорные реакции и робастная оптимизация на математическом уровне для защиты обновления градиентов в обучении с подкреплением. Также анонсировано создание группы для участников конференции IJCAI 2026. В ней будут предоставляться данные о дедлайнах, нормах оформления, ходе рецензирования, возможности общения с коллегами, доступа к актуальным исследованиям и помощи на самой конференции (навигация по месту проведения, обсуждение сессий, сбор материалов с постеров и др.). Для вступления в группу нужно отсканировать QR‑код или добавить в контакты WhatsApp Qvv0909777, указав в заметке: IJCAI + учреждение/вуз + фамилия + направление.

// оригинал
Leiphone ↗ Читать оригинал
26 просмотров
// поделиться Telegram VK