DeepDigest
Leiphone · · ~3 мин

От симуляции к реальности: вызовы для агентов на базе больших моделей

Профессор Вэй Хуа на IJCAI 2026 обсудил проблемы перехода от симуляции к реальности для интеллектуальных агентов на базе больших языковых моделей. Он провёл параллель между уязвимостями современных моделей и проблемой Sim-to-Real в RL. Для решения проблем предложены доменная рандомизация и количественная оценка неопределённости.

От симуляции к реальности: вызовы для агентов на базе больших моделей

Профессор Вэй Хуа из Университета штата Аризона (ASU) на конференции IJCAI в Германии в 2026 году поднял вопрос перехода от симуляции к реальности для интеллектуальных агентов на базе больших языковых моделей. Он отметил, что такие агенты сталкиваются с теми же проблемами, что и модели обучения с подкреплением (RL) десять лет назад при управлении движением на перекрёстках.

В 2017 году команда Вэй Хуа доказала, что RL может идеально воспроизводить традиционные решения «зелёной волны» и находить более оптимальные стратегии. Однако при переносе из лаборатории в реальную среду (например, в транспортную сеть в Ханчжоу, Китай) обнаружились отклонения в симуляторах. Причина — влияние погоды, ракурса камер, особенностей определения функции вознаграждения.

Проблема переноса из симуляции в реальность (Sim-to-Real) разбита на пять подизмерений:
* разрыв в наблюдениях (Observation Gaps);
* разрыв в состояниях (State Gaps);
* разрыв в действиях (Action Gaps);
* динамический разрыв (Dynamics Gaps);
* разрыв в наградах (Reward Gaps).

Пример динамического разрыва: в симуляторе при переключении на зелёный свет все машины проезжают, а в реальности в плохую погоду (дождь, туман, снег) за то же время проедут меньше машин. Это ведёт к расхождениям в последующих состояниях.

В работах на AAAI 2024 исследователи пытались уменьшить разрыв, добавляя в качестве входных данных информацию о погоде, но идеального решения не достигли. Также есть проблемы с разрывами в наблюдениях (в плохих погодных условиях или ночью датчики дают искажённую картину) и в наградах (в симуляторе цель — минимизировать время проезда машин, а в реальности нужно учитывать безопасность пешеходов и другие факторы).

Большие языковые модели в роли интеллектуальных агентов сталкиваются с трудностями при переключении с английского на китайский, немецкий или малоресурсные языки — уровень ошибок резко возрастает. На конференции KDD проблему надёжности базовых моделей предложили рассматривать как задачу «от симуляции к реальности»: данные для обучения модели преимущественно на английском (как симулятор), а тестирование — на других языках (как реальный мир).

Для решения проблемы Вэй Хуа предложил применять техники из робототехники, например доменную рандомизацию (Domain Randomization). Она подразумевает масштабное «случайное переписывание и возмущение» входных текстов, подсказок, описаний параметров, пространств действий и вознаграждений. В результате модель с 3 млрд параметров (3B) после доменной рандомизации по способности преодолевать различия между средами почти идеальна — она превосходит модель с 32 млрд параметров (32B).

Ещё одно важное направление — количественная оценка неопределённости (Uncertainty Quantification). Необходимо, чтобы машина понимала, когда она не уверена, и могла либо самостоятельно принимать решение, либо обращаться за помощью к человеку. Определены четыре уровня количественной оценки неопределённости для больших моделей:
1. Надёжность самого ответа.
2. Уязвимость логики рассуждений модели.
3. Возможность точно определить, на каком этапе рассуждения допущена ошибка.
4. Соответствие познания агента другим моделям или системам.

Кроме того, требуется разработать общий словарь и стандарты оценки для разных областей (робототехника, обучение с подкреплением и др.), чтобы тестировать и обмениваться технологиями.

Среди исследовательских разработок в этой сфере:
* IntelliLight — подход на основе обучения с подкреплением для интеллектуального управления светофорами (KDD2018, Hua Wei и др.);
* PressLight — обучение управлению с максимальным давлением для координации сигналов светофоров в артериальной сети (KDD 2019, Longchao Da и др.);
* SynTraC — синтетический набор данных для управления сигналами светофора на основе данных с камер мониторинга трафика (ITSC’24, 27th IEEE International Conference on Intelligent Transportation Systems, Tiejin Chen и др.).

Также доступны научные работы:
* A Survey of Sim-to-Real Methods in RL: Progress, Prospects and Challenges with Foundation Models (https://arxiv.org/abs/2502.13187, Longchao Da и др.);
* Prompt to transfer: Sim-to-real Transfer for Traffic Signal Control with Prompt Learning (AAAl’24, 2024, Tiejin Chen и др.);
* «The Sim-to-Real Gap of Foundation Model Agents: A Unified MDP Perspective» (Proceedings of the 32nd SIGKDD Conference on Knowledge Discovery and Data Mining, KDD’26, Xiaoou Liu и др.).

:IJCAI:

// оригинал
Leiphone ↗ Читать оригинал
2 просмотров
// поделиться Telegram VK