На конференции RSS 2026 в Сиднее активно обсуждались перспективы развития воплощённого интеллекта. Ли Фэйфэй и его ученик Хуан Вэньлун (Wenlong Huang) из лаборатории Стэнфорда выступили с идеей о необходимости революции «мозгового поиска» для развития таких систем.
Сегодня в сфере AGI большие языковые модели достигают интеллекта за счёт анализа текстов из интернета (Scaling Law). В последние два года в отрасли наблюдался культ данных: считалось, что миллионы часов видео позволят роботам добиться универсальности в физическом мире. Однако на RSS 2026 эксперты обратили внимание на ряд проблем. Одна из них — необратимость сбора данных в физическом мире: в отличие от текста, который можно бесконечно копировать, действия робота (например, захват чашки) требуют реального времени и ресурсов. Другая проблема — «длинный хвост»: невозможно собрать все возможные сценарии для робота (трение, деформация, жидкости и т. д.).
Хуан Вэньлун на Workshop «Data-Centric Robotics» (робототехника, ориентированная на данные) предложил перейти от запоминания большого объёма демонстрационных данных к контрфактическому рассуждению и внутреннему поиску. В предыдущих работах (VoxPoser и ReKep) он использовал большие модели как планировщик пространства: преобразовывал абстрактные команды человека в ограничения ключевых точек и ценностные поля в 3D-пространстве. Это позволило роботам выполнять сложные задачи без демонстраций, опираясь на геометрические знания.
На RSS 2026 Хуан представил концепцию Point-World — финальную форму 3D-модели мира. Point-World даёт роботу «цифровой двойник мозга», позволяющий предсказывать физическое развитие событий без примеров. Робот может виртуально испытать тысячи контрфактических сценариев и самостоятельно генерировать новые действия (например, вывернуть носок).
Хуан продемонстрировал, что 15 часов 3D‑взаимодействий в сочетании с 2D‑предварительным обучением способны значительно расширить возможности модели мира. Это приближает к реализации рекурсивного самосовершенствования (Recursive Self-improvement) — непрерывного автономного обучения робота.
Работа Point-World строится следующим образом:
* пространство действий робота определяется как 3D‑потоки точек (3D Point Flows) на основе RGB‑D‑входа и файла описания робота (URDF);
* выбираются точки с каждого звена робота, рассчитывается прямая кинематика;
* наблюдения за сценами и действия робота объединяются в 3D‑потоке точек;
* модель обучается на базе Transformer как «нулевого» (Zero‑shot) симулятора реального мира.
Модель способна моделировать не только твёрдые тела, но и жидкости, ткани и другие деформируемые объекты без их разделения. Она может неявно распознавать структуру подвижных соединений объекта (например, у холодильника) и в условиях скрытия объекта (например, при виде с первого лица на заднюю часть коробки) — на основе физических знаний выводить геометрические отношения контакта.
С помощью современных моделей геометрической визуализации проведена повторная разметка большого массива интерактивных данных (Joy dataset) — сгенерированы 3D‑облака точек с информацией о глубине с точностью для симуляции и положении камеры. Всего сгенерировано около 3500 часов данных. Это позволяет повысить точность мировой модели за счёт увеличения параметров и оптимизации целей обучения.
В неопубликованной работе показано: предварительная подготовка на 2D‑видеоданных с последующей тонкой настройкой на 15 часах 3D‑интерактивных данных даёт более качественное прогнозирование динамики среды, чем обучение на 500 часах данных. Модель сохраняет высокую физическую точность в незнакомых средах и с незнакомыми роботизированными манипуляторами.
Команда из Стэнфорда предлагает подход, при котором роботу не нужно сталкиваться со всеми возможными неудачами — достаточно научиться «восполнять» в уме альтернативные варианты. Например, задача от Physical Intelligence — переворот носка с помощью обычного параллельного захвата (робот вставляет захват в носок и с помощью второго захвата выполняет действие). Такие действия сложно описать текстом или кодом, требуется визуализация. У людей есть способность к самостоятельному созданию решений в новых ситуациях, которой не хватает роботам. Для воспроизведения человеческой изобретательности важен контрфактический подход: модель оценивает, каким будет результат при других действиях.
Рассмотрение пространств для контрфактических рассуждений показывает, что оптимальное из них — 3D-геометрическое. Пространство языка и кода (попытка 2021 года с использованием больших языковых моделей) не справилось с описанием физических деталей. Пространство действий осложнено различиями в конструкции роботов.
Пример из истории ИИ — ход № 37 в AlphaGo: нестандартное решение, найденное через поиск и анализ. При удалении процесса поиска из тестирования модели потребовалось бы в 100 000 раз больше данных для сохранения производительности.
Достижения в создании «открытых мировых роботов» наблюдаются на двух уровнях:
* на алгоритмическом — диффузионные стратегии (Diffusion Policies), архитектуры на основе VLM, мировые модели;
* на аппаратном — снижение порога входа за счёт дешёвого оборудования.
Параллельно NVIDIA Cosmos 3 пытается определить экосистему телеприсутствия через мультимодальные подходы, в то время как Хуан и команда Стэнфорда предлагают алгоритм, позволяющий преодолеть ограничения вычислительной мощности и доступа к данным.
Также анонсируется RSS 2026: идёт набор исследователей в группу для отслеживания статей и обсуждения технологий. Для присоединения нужно отсканировать QR‑код или добавить в контакты Luyoyo_2026 в WeChat, в комментарии указать « + AI ».
:RSS:,