На конференции CVPR 2026 открылась новая эпоха воплощённого интеллекта в области 3DGS (3D Gaussian Splatting). Технология эволюционирует в цифровую фабрику-двойник для обучения роботов: она включает мгновенную прямую генерацию, Neural ODE для моделирования физических столкновений и реальное построение карт с шумоподавлением.
За последние два года в развитии 3DGS выявилась серьёзная проблема: алгоритмы показывают высокое качество 3D‑рендеринга в исследованиях, но на реальных устройствах (телефонах, роботах) работают нестабильно. На CVPR 2026 фокус сместился с улучшения качества изображения на промышленное внедрение. Среди ключевых направлений — секундное предварительное генерирование, реструктуризация GPU‑операторов, шумоподавляющее SLAM‑построение карт и расчёты физических столкновений с помощью Neural ODE.
Традиционные рабочие процессы 3DGS требуют значительных усилий: для каждой новой серии изображений нужны десятки минут итеративной оптимизации. Ранние алгоритмы использовали стратегию Pixel‑aligned — для каждого пикселя создавался 3D‑гауссовский элемент, что приводило к избыточному объёму данных. Решение проблемы — переход от итеративной оптимизации к feed‑forward нейросетям для секундного или миллисекундного генерирования изображений, а также динамическое распределение количества и плотности гауссовских элементов в зависимости от сложности сцены и производительности оборудования.
Одно из решений — исследование EcoSplat (авторы: Jongmin Park, Minh‑Quan Viet Bui, консультанты — Munchurl Kim (KAIST), Jihyong Oh (Центральный университет)). В работе «EcoSplat: Efficiency‑controllable Feed‑forward 3D Gaussian Splatting from Multi‑view Images» представлен «важность‑планировщик». Процесс обучения делится на два этапа: базовое обучение для предсказания гауссиан и микронастройка с «важность‑чувствительным прозрачным потерями» для снижения прозрачности неважных гауссиан и построения механизма ранжирования важности гауссовых элементов. Система принимает целевое количество гауссиан K (например, 500 тыс. или 50 тыс.) и в течение миллисекунд выбирает наиболее важные комбинации Top‑K в соответствии с бюджетом вычислительных ресурсов. На наборе данных RealEstate10K при сокращении гауссовых элементов до 5 % (около 78 тыс. гауссиан) EcoSplat сохраняет качество рендеринга на уровне 24,72 dB PSNR.
Ещё одно решение — SparseSplat. Оно решает задачу интеллектуальной разреженности гауссового распределения. SparseSplat использует понятие информационной энтропии (Shannon Entropy): вычисляет сложность локального окна в процессе вывода, для плоских поверхностей использует несколько крупных гауссиан, для сложных текстур — множество мелких. Отказывается от глобального прогнозирования отдельных точек, вместо этого использует поиск K ближайших соседей в 3D‑пространстве (3D KNN) и механизм геометрически осознанного внимания (Geo‑aware Attention) для точного прогнозирования свойств гауссиан. На наборе данных DL3DV SparseSplat с 150 тыс. гауссиан (22 % от 6,88 млн гауссиан у традиционных моделей) достигает качества рендеринга, сопоставимого или превосходящего SOTA (24,20 dB PSNR). При сжатии до 10–40 тыс. гауссиан частота кадров достигает 600–1100+ FPS.
В промышленных сценариях (беспилотный осмотр городских районов, виртуальный музей, симуляция автономного вождения) масштаб сцен велик: количество гауссовых элементов достигает миллионов и десятков миллионов. Возникают избыточные вычисления из‑за повторного отсечения по пирамиде видимости и сортировки по глубине, а неравномерная геометрическая сложность объектов приводит к дисбалансу нагрузки на GPU. Исследователи на CVPR 2026 внедрили механизм кэширования, балансировку нагрузки и одноэтапную геометрическую инициализацию — это позволило повысить частоту кадров и скорость сходимости.
Команда Шанхайского университета транспорта и UIUC (Иллинойсский университет в Урбане‑Шампейне) разработала CaT‑GS. В работе «CaT‑GS: Efficient 3DGS Rendering for Large Scale Scenes via Inter‑frame Caching and Tile Scheduling» (https://arxiv.org/abs/2607.17842) предложено использовать в рендеринге 3DGS принципы кэширования и упреждающего планирования из игровых движков. CaT‑GS делит процесс рендеринга на ключевые и подчинённые кадры. На этапе ключевого кадра применяется упреждающая многокадровая предобработка: прогнозируется траектория камеры, вычисляются охватывающие объёмы для будущих кадров. Подчинённые кадры используют кэшированные данные (отсечение по пирамиде видимости и сортировка) из ключевого кадра, избегая повторных вычислений. Для решения проблемы неравномерной нагрузки на ядра GPU в CaT‑GS перестроен CUDA‑рендер‑оператор: внедрён механизм разделения задач с учётом нагрузки (Load‑Aware Task Splitting) — тяжёлые тайлы с большим числом гауссовых элементов разбиваются на подзадачи и распределяются по SM GPU. Также математически перестроена формула альфа‑смешивания, чтобы сохранить точность цвета после параллельных вычислений. На наборе данных UAV City (более 700 тыс. гауссовых элементов) CaT‑GS обеспечил ускорение рендеринга в 10 раз по сравнению с традиционным 3DGS, достигнув более 200 FPS в разрешении 1080p.
EDGS (от CompVis лаборатории Мюнхенского университета и MCML, авторы — Dmytro Kotovenko и Olga Grebenkova) устраняет необходимость в процессе разделения (densification) в 3DGS. В основе EDGS — высококачественная инициализация вместо итеративного «метода проб и ошибок». Используется алгоритм сопоставления 2D‑признаков (например, RoMa) для плотного сопоставления пикселей и триангуляции многовидовых изображений. EDGS сразу создаёт высококачественный слой 3D‑гауссовых точек, предварительно рассчитывая их положение, цвет, масштабирование и коэффициенты сферических гармоник (SH). Пространственное смещение гауссовых точек в последующей оптимизации сокращается в 50 раз. EDGS требует лишь 15 % времени обучения традиционного 3DGS (5000 шагов) для достижения качества, сопоставимого с 30 000 шагами традиционного метода. Ссылка на статью:
Статья TokenGS (CVPR 2026) предлагает новую архитектуру, отделяющую предсказание 3D‑гаусса от расчёта по пикселям, что позволяет гибко развёртывать 3DGS на конечных устройствах и выполнять онлайн‑микронастройку. Исследование NVIDIA (авторы: Jiawei Ren, Michal Jan Tyszkiewicz, Jiahui Huang, Zan Gojcic) представлено в работе «TokenGS: Decoupling 3D Gaussian Prediction from Pixels with Learnable Tokens». В TokenGS перестроена традиционная архитектура «пиксель — гаусс»: применена идея обучаемых токенов (Learnable Tokens) из области компьютерного зрения (по аналогии с DETR), создана новая архитектура Encoder‑Decoder. Особенности архитектуры:
* извлечение признаков из многовидовых изображений и передача их в Transformer‑декодер;
* использование обучаемых 3D‑пространственных токенов для прямого запроса и регрессии 3D‑гауссовых координат и физических свойств в глобальном пространстве.
Преимущества TokenGS:
* высокая устойчивость к шуму (в т. ч. к шуму положения камеры — Pose Noise): модель строит чистые и гладкие 3D‑поверхности даже при отклонениях в положении камеры на входных изображениях;
* возможность онлайн‑микронастройки на устройстве (Test‑Time Token Tuning, TTT): не требуется переобучение основной сети (Backbone), достаточно заморозить параметры основной сети и микронастроить лёгкие 3D‑токены.
Результаты оценки: при обработке новых сложных сцен и входных данных с отклонением положения камеры достаточно малого числа шагов микронастройки токенов на устройстве — это значительно улучшает качество рендеринга, снижает потребление видеопамяти и вычислительных мощностей на устройстве, предотвращает утрату параметров модели из‑за переобучения. TokenGS демонстрирует переход 3DGS от примитивной модели «привязки к пикселям» к модульной, слабосвязанной и динамически обновляемой архитектуре нейронных сетей.
Проблема 3DGS — невозможность взаимодействия с физическим миром: отсутствие данных о массе, скорости, механизмов коррекции сенсоров мешает использовать модели в навигации роботов, физических движках игр, обучении моделей для автономного вождения и интеллектуальных систем. Работы, представленные на CVPR 2026, решают проблему интеграции 3DGS в промышленное производство — они охватывают три направления: построение карт с помощью визуального SLAM, непрерывное физическое моделирование и синтез данных для встроенных интеллектуальных систем.
Исследование SGAD‑SLAM (NUDT и Чжуншаньский университет, автор — профессор Сюй Кай) предлагает фреймворк для 3DGS с коррекцией глубины в реальном времени для навигации роботов и дронов. Проблема: шум и смещение глубины (Depth Offset) в данных RGB‑D‑сенсоров приводят к геометрическим искажениям и рискам столкновений в SLAM. Решение: модуль Adjusted Depth для коррекции глубины в процессе обучения и построения карты, оценка и компенсация системных смещений глубины через репроекцию и локальную геометрическую согласованность. Результат: гладкие и точные гауссовы карты и траектория камеры даже в шумных и плохо освещённых условиях. Ссылка:
Исследование ParticleGS (Чжэцзянский университет, автор — профессор Явэй Ло) решает проблему работы с динамическими объектами в 3DGS. Проблема традиционных моделей: неспособность предсказывать движение за пределами тренировочного видео или при внешних воздействиях (столкновениях). Решение: представление 3D‑гауссовых элементов как физических частиц (Particle) с параметрами позиции, массы, скорости и сил взаимодействия между частицами. Название статьи: «ParticleGS: Learning Neural Gaussian Particle Dynamics from Videos for Prior‑free Physical Motion Extrapolation». ParticleGS использует Neural ODE для точного моделирования непрерывных физических процессов: в скрытом пространстве алгоритм изучает нейромеханические поля во времени, аппроксимируя законы сохранения импульса, инерции и отскока при столкновении, что позволяет выполнять экстраполяцию будущего движения. В робототехнике и игровой симуляции система рассчитывает будущие траектории отскока и деформации объектов на основе физических законов — 3DGS превращается из статичных пикселей в объекты с динамическим откликом.
Исследование проведено командой Пекинского технологического университета, автор — профессор Юйфэн Юэ (Yufeng Yue). Работа представлена в статье «Video2Robo: 3DGS‑based Synthetic Data from One Video Enables Scalable Robot Learning» (https://openaccess.thecvf.com/content/CVPR2026/papers/Deng_Video2Robo_3DGS‑based_Synthetic_Data_from_One_Video_Enables_Scalable_Robot_CVPR_2026_paper.pdf). Video2Robo позволяет создавать данные для обучения роботов на основе обычного видео с телефона: с помощью 3DGS строится цифровое двойниковое пространство и синтезируются большие объёмы данных для обучения. Рабочий процесс Video2Robo:
1. Извлечение 3D‑ресурсов из моновидео: система автоматически отделяет объект и окружение, создавая decoupled 3DGS‑модель объекта.
2. Универсальное усиление данных (Real2Sim2Real): в 3DGS‑пространстве можно менять освещение, фон, ракурс камеры и начальное положение объектов, генерируя тысячи реалистичных симуляций.
3. Обучение и развёртывание замкнутой стратегии: данные подаются на обучение сквозной визуальной стратегии робота (Sim‑to‑Real); навыки, усвоенные в виртуальной среде, успешно переносятся в реальный мир.
Video2Robo сокращает срок подготовки данных для обучения роботов с недель до часов.
3DGS (3D Gaussian Splatting) перестал быть «академическим прототипом» и стал промышленной инфраструктурой, интегрируемой с SLAM‑навигацией, физическими движками и системами обучения роботов. Примеры разработок: SGAD‑SLAM (реальная коррекция шума глубины в реальном времени), ParticleGS (моделирование физической динамики на основе Neural ODE), Video2Robo (конвейер синтеза данных для воплощённого интеллекта).
3DGS обеспечивает:
* генерацию с задержкой в секунды и гибкое управление вычислительными ресурсами на производственном этапе;
* перестройку GPU‑операторов и оптимизацию конвейера на этапе выполнения;
* тонкую настройку архитектуры и системную интеграцию на прикладном уровне.
3DGS становится физическим фундаментом для воплощённого интеллекта и моделей автономного вождения. Благодаря адаптивному управлению вычислительными ресурсами, интерфейсам датчиков с подавлением шума в реальном времени и возможностям физического столкновения на основе Neural ODE, обучение роботов перестаёт сильно зависеть от дорогостоящего ручного управления.
Для полного внедрения 3DGS в промышленность нужно решить ряд задач:
* отделить материал от освещения — разложить гауссовы элементы на параметры материала PBR (шероховатость, нормали) для интеграции с динамическими системами освещения (например, Unreal Engine 5);
* ускорить работу за счёт совместной работы ПО и аппаратных средств;
* разработать промышленные стандарты передачи данных.
В будущем SoC для мобильных устройств могут включать специализированные модули для ускорения гауссова рендеринга, а стандарты сжатия (например, от MPEG) позволят эффективно передавать большие сцены.
Китайские университеты (Фудань, Шанхайский технологический университет, Шанхайский транспортный университет) и компании (например, Yituo Intelligence) играют ведущую роль в развитии пространственных вычислений и инфраструктуры для воплощённого интеллекта.