DeepDigest
Leiphone · · ~4 мин

AdvNav: фреймворк для атак на системы визуальной языковой навигации

Команда профессора Чэнь Чанхао разработала фреймворк AdvNav для «чёрного ящика» атак на системы визуальной языковой навигации. В тестах на наборе данных R2R фреймворк показал высокую эффективность атак на модели HAMT и MapGPT. Результаты выявили скрытые уязвимости в системах VLN и открывают новые возможности для оценки безопасности и робастности ИИ.

AdvNav: фреймворк для атак на системы визуальной языковой навигации

Команда профессора Чэнь Чанхао из Гонконгского университета науки и технологии (Гуанчжоу) разработала фреймворк AdvNav — первый инструмент для проведения «чёрного ящика» атак на системы визуальной языковой навигации (VLN). Суть подхода заключается в том, чтобы добавлять контролируемые возмущения к изображениям, которые «видит» робот, анализировать его поведение и оптимизировать возмущения на основе полученных данных.

AdvNav не требует доступа к параметрам модели или градиентам — оптимизация атаки осуществляется через наблюдение за поведением навигационного агента. В фреймворке реализована двухуровневая система обратной связи, которая включает:

  1. Оценку на уровне траектории: используются показатели SPL (Success weighted by Path Length) и NE (Navigation Error) для формирования совокупного показателя эффективности атаки. Цель — увеличить NE и снизить SPL, чтобы продемонстрировать значительное нарушение навигации.
  2. Оценку на уровне действий: вводится совокупная награда за действия, чтобы количественно оценить влияние возмущений на способность робота выбирать правильные действия в каждый момент времени. Учитывается вероятность выбора эталонного действия и наиболее вероятного ошибочного действия.
  3. Совокупный двууровневый набор обратной связи: объединяет сигналы для оценки каждого кандидата на возмущение в текущем раунде.

Кроме того, в AdvNav применяются адаптивная регулировка интенсивности помех и генетический алгоритм для оптимизации структуры шума. Процесс адаптивной оптимизации возмущений включает несколько этапов:

  1. Генерация кандидатов на совокупное возмущение: к текущему совокупному возмущению с фиксированным шагом и совокупным знаком добавляются возмущения, полученные из группы шумов.
  2. Оценка эффективности атаки: для каждого кандидата на совокупное возмущение формируется двууровневый совокупный набор обратной связи, рассчитывается относительная выгода атаки (разница показателей на уровне траектории или действий между кандидатом и предыдущим совокупным возмущением).
  3. Обновление возмущения: кандидаты ранжируются по относительной выгоде атаки, отбрасываются кандидаты с отрицательной выгодой; если наилучший кандидат эффективен, он становится новым совокупным возмущением; если нет — сохраняется предыдущее совокупное возмущение, меняется совокупный знак и выполняется генетическая эволюция группы шумов.

В тестах на классическом наборе данных R2R фреймворк показал следующие результаты по успешности атак:
* для модели HAMT с архитектурой Transformer — средняя эффективность атаки составила 49,7 % на 11 сценариях, максимальная — 100 %;
* для модели MapGPT на базе большой языковой модели с использованием моделей Qwen3-VL и GPT-4V в качестве базовых сетей эффективность атаки составила 65,96 % и 87,30 % соответственно.

В абляционных экспериментах были получены следующие результаты:
* при случайном возмущении эффективность атаки — 23,40 %;
* при удалении действия по награде на уровне действий из двойной гранулярной обратной связи эффективность атаки снижается на 17,02 %;
* при удалении оценки производительности на уровне траектории — на 2,13 %;
* при удалении эволюции структуры возмущения — до 38,30 %;
* при удалении обновления интенсивности возмущения — до 26,60 %.

Визуальные результаты демонстрируют, что AdvNav показывает значительно более низкие значения LPIPS (Learned Perceptual Image Patch Similarity) по сравнению с другими возмущениями. Это указывает на хорошую скрытность возмущений. Возмущения, оптимизированные с помощью AdvNav, формируют низкочастотный когерентный световой поток, снижая контраст структурных сигналов и затрудняя их подавление стандартными методами предварительной обработки. В результате возникают постоянные отклонения в поведении навигации.

Результаты исследования показали наличие скрытых уязвимостей в современных системах визуальной языковой навигации. AdvNav может использоваться как метод оценки безопасности систем VLN и инструмент стресс‑тестирования, а также открывает новые возможности для исследования робастности воплощённого ИИ. В будущем фреймворк может найти применение в области состязательного обучения, проектирования робастных навигационных моделей и оценки безопасности воплощённого ИИ для создания более надёжных систем навигации в открытых пространствах.

Работа принята к публикации на ACM Multimedia 2026 (ACM MM 2026). Название статьи: AdvNav: Behavior-Guided Black-Box Adversarial Attacks on Vision-Language Navigation. Ссылка на статью:

Среди авторов исследования:
* Ли Чэньян (исследовательский ассистент Гонконгского университета науки и технологии (Гуанчжоу), ныне исследовательский ассистент Национального университета Сингапура) — направление: безопасность ИИ, построение доверенного и объяснимого физического ИИ и генеративного ИИ;
* Ли Каге (исследователь/докторант Института кибербезопасности Университета Чжуншань) — направление: компьютерное зрение, мультимодальные большие модели, безопасность контента ИИ;
* Цзян Цзэюй (аспирант Гонконгского университета науки и технологии (Гуанчжоу)) — направление: эффективный пространственный физический интеллект, внедрение общего пространственного интеллекта в реальные сценарии применения в открытых средах;
* Чэнь Чанхао (корреспондент, ассистент профессора в области интеллектуального транспорта и ИИ Гонконгского университета науки и технологии (Гуанчжоу), ассистент профессора междисциплинарного отдела Гонконгского университета науки и технологии) — исследования в области восприятия, навигации и взаимодействия воплощённого ИИ, руководитель группы PEAK-Lab в качестве независимого PI.


// оригинал
Leiphone ↗ Читать оригинал
2 просмотров
// поделиться Telegram VK