Национальный университет Цинхуа и NVIDIA провели масштабное исследование визуальных способностей языково-визуальных моделей (VLM), включая Gemini 2.0 и GPT-4.1. Результаты опубликованы в работе «VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning» (https://arxiv.org/pdf/2607.0048301).
В ходе исследования модели решали 10 типовых задач в четырёх симуляторах для воплощённого ИИ. Среди задач были: балансировка перевёрнутого маятника (Cart Pole), выпрямление верёвки (Straighten Rope), перемещение чашки с водой (Pass Water), забивание мяча в ворота (Soccer), заталкивание блоков в отверстие (Sweep Into), открывание ящика (Open Drawer), а также действия в «Майнкрафте» — убийство паука (Combat Spider), доение коровы (Milk Cow), стрижка овец (Shear Sheep), преследование коровы (Hunt Cow).
Модели получали данные в формате первого лица (RGB‑видео) и текстовое описание задачи. Им нужно было определить, какой из двух случайно выбранных кадров показывает более близкое к цели состояние агента. Для каждой задачи подготовили по 100 пар контрольных кадров с псевдоистинными значениями — это позволило оценить точность суждений VLM‑моделей.
Результаты тестов показали значительные различия в эффективности моделей:
* Gemini‑2.0‑Flash достигла точности более 70 % по всем 10 задачам: в задаче Cart Pole — 91 %, в задачах MetaWorld (механическая рука) — 84–87 %;
* GPT‑4.1‑nano показала точность 60–66 % в большинстве задач, в задаче Soccer — 60 %;
* CLIP и MineCLIP показали низкие результаты: MineCLIP в задаче MineDojo — 39–59 %;
* Phi‑3.5‑Vision‑Instruct (4.15B параметров) показала точность 90 % в задачах «выдаивание коровы» и «стрижка овец» в «Майнкрафте»;
* DeepSeek‑VL2‑Tiny (3.37B параметров) достигла 85 % в задаче «борьба с пауками»;
* MiniCPM‑o‑2.6 (8.67B параметров) показала 73 % точности в задаче «наливание воды».
При этом использование больших моделей (например, Gemini 2.0) для оценки RL‑агентов сталкивается с рядом проблем. Во‑первых, это высокие затраты и задержки из‑за частых API‑запросов при оптимизации стратегий в обучении с подкреплением (требуется взаимодействие в десятки и сотни тысяч шагов). Во‑вторых, чрезмерное использование VLM API (десятки тысяч вызовов) ведёт к стоимости обучения в несколько тысяч долларов за одну тренировку и замедлению RL‑тренировки в десятки раз из‑за задержек.
Традиционный подход с абсолютными оценками (как в RL‑VLM‑F) имеет существенные недостатки. Например, оценка сильно смещается в ходе тренировки: в «Майнкрафте» при выполнении задачи «доение коровы» оценки в 512k и 942k шагов сильно различаются. В циклических задачах (например, в Ringworld) агент попадает в тупик и не получает дохода (0).
Чтобы решить эти проблемы, команда Цинхуа и NVIDIA разработала фреймворк VLM‑AR3L. В нём большая модель выполняет офлайн‑маркировку, а локальная облегчённая сиамская сеть руководит процессом. В VLM‑AR3L используется комбинация абсолютного и относительного вознаграждения:
* абсолютное вознаграждение (Absolute Reward) показывает, насколько текущее состояние близко к цели, даёт агенту общее направление;
* относительное вознаграждение (Relative Reward) сравнивает текущее наблюдение s_t с наблюдением из прошлого sₜ₋ₖ (с временным сдвигом k=1), чтобы определить, продвинулся ли агент.
Для снижения риска галлюцинаций модели применены двусторонние симметричные правила проверки достоверности: положительное вознаграждение выдаётся, только если относительная модель с высокой уверенностью подтверждает, что текущее состояние лучше предыдущего, а предыдущее — хуже текущего.
Частота запросов к API снижена в 20 раз за счёт разделения процесса на две линии: офлайн‑маркировка большой моделью и руководство со стороны локальной сети. Задний асинхронный маркировочный процесс работает так: большая модель периодически отбирает изображения из Replay Buffer и генерирует метки предпочтений. Эти метки используются для обучения малого сиамского сетевого модуля. В процессе обучения стратегии RL на переднем плане агент напрямую использует этот лёгкий сетевой модуль для получения вознаграждения.
VLM‑AR3L показал высокую успешность в задачах в сложных средах (например, в «Майнкрафте»): в Combat Spider — 85 %, в Milk Cow — 95 %. В задачах, требующих длительного исследования (например, дойка коров, стрижка овец, охота на быков), агенты с ручным заданием вознаграждений не могли научиться выполнять задачи (успешность 0). При этом VLM‑AR3L успешно обучил агентов благодаря плотным и стабильным сигналам прогресса, превзойдя ручные метки вознаграждений.
В будущем в парадигме воплощённого интеллекта большие модели будут выполнять роль «главного тренера»: оценивать прогресс, выполнять офлайн‑маркировку и передавать свои знания лёгким стратегическим моделям.
Дата публикации исследования — 2026-09-03.