Ли Фэйфэй продвигает идею пространственного интеллекта — подхода, который должен помочь преодолеть ключевую проблему сгенерированных ИИ миров: их практическую бесполезность. Главная трудность заключается в отсутствии у ИИ «подсчёта» — записи состояния мира, которую можно проверить и откатить. Пространственный интеллект предполагает переход от распознавания 2D‑изображений к пониманию, рассуждению и созданию 3D‑мира, в который можно войти, которым можно управлять и который можно редактировать.
Ли Фэйфэй выделяет три ключевых компонента такой системы:
* Renderer — отображает мир;
* Simulator — фиксирует текущее состояние мира и то, как оно изменится после действий;
* Planner — определяет следующие действия.
Ключевой элемент — общий слой состояния («подсчёт»), от которого зависит возможность продолжения работы сгенерированного мира. Когда процесс самокоррекции становится стандартизированным, это называется рекурсивным самосовершенствованием (Recursive Self‑Improvement, RSI). Система сохраняет полный путь «состояние — цель — действие — новое состояние — проверка — обратная связь», выявляет пробелы в возможностях в ходе реального взаимодействия, автоматически генерирует новые задачи и сложные примеры, а затем запускает следующую итерацию после независимой оценки, контроля версий и отката.
Пространственный мир служит идеальной средой для тестирования этого цикла: в нём есть чёткие объекты, выполнимые действия и проверяемые результаты. Генеративный ИИ начинает создавать миры со пространственными свойствами — в них можно входить, управлять ими и продолжать творчество. 3D‑мир объединяет восприятие, рассуждение, код, физику и взаимодействие в одну задачу.
Есть уже показательные примеры таких миров. В официальном демо Kimi K3 естественный язык превращается в программный открытый мир в браузере: верховая езда, лес, деревня, горы, водоёмы и погода отображаются в одном кадре. Это демонстрирует способность модели объединять 3D‑рассуждение, генерацию кода, вызов инструментов и визуальную обратную связь в единый рабочий процесс. MiniTown, созданный с помощью GPT‑5.6 и Codex, идёт дальше: помимо домов и дорог, в едином состоянии организованы зоны, расписания жителей, транспортные средства и цикл день‑ночь.
Создание исполняемого мира включает три типа состояний:
* семантическое (что представляет объект и его функции);
* геометрическое (размеры, положение, границы, топология);
* рабочее (статус объектов — например, открыта ли дверь, выполняет ли персонаж задачу).
Процесс построения мира выглядит так: перевод естественного языка в цели и ограничения → разработка пространственной модели → пополнение объектов системой активов → обработка границ, столкновений и связей решателем → выполнение и рендеринг движком → проверка валидатором возможности принятия нового состояния. Цепочка сводится к «представление — переход — проверка»: описание текущего мира, расчёт изменений от действий, проверка нового состояния на соответствие геометрическим, физическим и целевым требованиям.
Можно выделить три направления построения исполняемых 3D‑миров:
* генерация мира на основе визуального восприятия;
* символическая/программная генерация мира с акцентом на идентичность объектов и правила;
* формирующаяся гибридная архитектура.
При этом существуют серьёзные технические ограничения. Результаты генерации несут слишком много состояний мира, но не имеют независимого, проверяемого и инкрементального учёта. Ключевые проблемы продуктов — время получения первого рабочего сценария и сохранение идентичности и связей после локальных изменений.
Проблемы скорости тоже ощутимы: первое возвращение данных происходит быстро, но первый эффективный результат достигается медленно из‑за этапов поиска активов, рендеринга, обнаружения столкновений, визуального контроля и исправлений. В тесте в среде A6000 среднее время работы LayoutGPT, Holodeck, SceneOrchestra и SceneWeaver — <<<CODE_BLOCK_N>>>.
Время генерации в World Labs:
* Draft — около 20 секунд;
* полный мир — 5 минут;
* высококачественный Mesh — около 1 часа (с возможностью продления с 3 минут до 91 минуты).
При повышении качества требуется больше раундов проверки и пересчёта, рабочий процесс становится более асинхронным. Метрики для высокочастотных пространственных инструментов должны смещаться от «первого отклика» к «первому эффективному времени».
Локальные изменения часто нарушают глобальную связность мира: меняются масштаб и детали при переключении ракурса, блокировке и возврате в сцену; перемещение объекта может нарушить коллизии, привязки, направления, пути. Примеры проблем:
* FloorplanQA — нарушение ограничений коллизий и путей;
* GameCraft‑Bench — локальные механизмы работают, но полная игра не удаётся;
* GEST — 50 попыток независимого вывода полного событийного графа LLM завершились неудачей (стабильность достигается при использовании процедурного бэкенда состояния).
SceneSmith показывает, что для включения в систему симуляции сцена должна содержать данные о коллизиях, качестве, инерции, трении и др. Для поддержания связности нужны: непрерывная идентификация объектов, граф отношений и зависимостей, журнал событий, история версий, инкрементный решатель и валидатор.
World Labs разделяет модель мира на Renderer (создание наблюдений), Simulator (поддержание геометрии, физических и динамических состояний), Planner (выбор действий на основе целей). Необходим уровень устойчивого состояния как интерфейс — он сохраняет идентификацию объектов, геометрию, отношения, ограничения, интерфейсы поведения, прогресс задач, источник, достоверность и версии, преобразует изменения в проверяемые локальные патчи.
SceneScript и HDSL позволяют записывать сцены в виде адресуемых и локально исправляемых команд или иерархических программ; OpenUSD обеспечивает непрерывное существование объектов и версий между инструментами.
Китайские компании (например, «») реализуют схожие подходы: объединяют модель состояния пространства, модель «пространство — действие» и движок исполнения вокруг единого состояния мира. MST‑Builder преобразует контент (графические материалы, товары, 3D‑активы, UGC) в пространственные токены с семантикой, геометрией, связями, данными об источнике и лицензиях. NSF использует непрерывные функциональные поля для определения подходящих мест для действий. Архитектура на основе базовых данных позволяет выполнять локальные изменения с инкрементальным пересчётом (за 20 секунд), а не перестраивать всё целиком.
Генерацию пространства можно представить как последовательность действий: создание, удаление, перемещение, замена, комбинирование, изменение границ, корректировка правил, планирование пути. Система сохраняет цепочку «текущее состояние — цель — действие — новое состояние — последствия», что позволяет обучать модель пониманию того, как действия меняют мир и как достичь цели через несколько шагов.
В робототехнике применяются:
* ConceptGraphs — преобразует непрерывное восприятие в обновляемую пространственную карту;
* SayPlan — генерирует планы из подграфов задач и перепланирует на основе обратной связи о невыполнимости;
* VoxPoser — реализует языковые ограничения в непрерывном трёхмерном поле значений.
Наблюдается тенденция к иерархической структуре: верхний уровень поддерживает долгосрочные цели, средний — планирует объекты и связи, нижний — решает геометрические задачи, задачи планирования пути и управления; при сбое происходит возврат к последнему стабильному состоянию.
Команда «Жизненная среда» встраивает сбор обратной связи в процесс пространственного творчества — система накапливает траектории перехода состояний, охватывающие действия по добавлению, удалению, перемещению, замене, отмене, сохранению и оценке объектов. Отмены действий можно преобразовать в контрфактические отрицательные примеры для обучения модели тому, «чего не следует делать». Последовательности непрерывного редактирования показывают, как долгосрочные цели разбиваются на несколько действий — это даёт основу для иерархического планирования.
Система проверки определяет, какой мир можно представить как замкнутый цикл: детерминированные правила проверяют формат, границы, жизненный цикл объектов и целостность зависимостей; геометрический расчёт и поиск пути оценивают пригодность пространства; мультимодальные модели анализируют перекрытия, семантику и визуальные последствия в целом; конечная обратная связь поступает от действий пользователя или задач робота. Диагностика проблем (выход объекта за границы, блокировка дверей, сбой опор, незавершённая задача) позволяет системе выполнять локальное исправление и направлять ошибки в соответствующие модели и этапы работы с данными.
От проверки «успешного рендеринга» отрасль переходит к проверке «правильности состояния и возможности выполнения задачи»:
* OptiScene преобразует ручную проверку в данные о предпочтениях;
* LayoutVLM интегрирует дифференцируемые ограничения в оптимизацию компоновки;
* SimWorld Studio объединяет компиляцию, физическую проверку и обратную связь от VLM для следующей итерации исправлений.
HiSQ‑Bench от команды «Жизненная среда» делит качество пространства на согласованность намерений, геометрическую обоснованность, пригодность пространства и эстетическое восприятие, использует агентов для выполнения задач (утренние действия, возвращение домой, исследование); исследование охватывает различные пространственные сценарии и разнообразные командные инструкции. VisAlign размещает структурированные решения в виртуальных комнатах, позволяя мультимодальному «судье» оценивать совместимость и визуальные дефекты после комбинирования. В оценке с помощью Gemini 2.5 Pro показатель Scene Compatibility составил 0. Значение показателя 73 выше SFT (0.56), показатель Artifact снизился с 0.24 до 0.15. Текущие агентские среды используют двумерное приближение, оценка зависит от модельного судьи. Будут проверены реальные трёхмерные столкновения, долгосрочное взаимодействие и возможность стороннего воспроизведения — это позволит определить границы применимости метода.
HiSQ: процесс самосовершенствования агента демонстрирует, как эталонные оценки выявляют пробелы в возможностях, а анализ показателей, планирование, разработка инструментов и генерация навыков ведут к следующему циклу создания и оценки сценариев. Генеративный ИИ преодолел этап создания мира, но остаётся вопрос, выдержит ли этот мир действия. В будущем при оценке мировых моделей по‑прежнему важны качество первого кадра и масштаб демонстрации, но ключевые показатели сместятся в сторону первого эффективного времени, коэффициента прохождения ограничений после локальных изменений, долгосрочной согласованности состояний и возможности выполнения реальных задач. Перцептивный и символьный подходы будут взаимодействовать через интерфейсы на уровне состояний в Renderer, Simulator и Planner. Генерация станет не просто «созданием мира», а предложением проверяемой версии мира. Компания «» (пространственный интеллект) на практике показала возможность такого сближения технологий: она пытается интегрировать мультимодальное пространственное кодирование, непрерывные поля, реальные траектории взаимодействия и проверку качества в единый замкнутый цикл. Требуется открытое обсуждение технологий, сторонние оценки и длительное тестирование, чтобы понять, можно ли расширить эту систему на другие типы пространств, формы машин и долгосрочные задачи. Ключевая задача отрасли: ИИ должен не только создавать мир, но и обеспечивать его устойчивость после каждого действия.