DeepDigest
Leiphone · · ~5 мин

Being-H0.8: модель скрытого пространства от BeingBeyond

Лу Цзунцин из Пекинского университета и его команда из BeingBeyond развивают модели действий в скрытом пространстве мира. В июле 2026 года они выпустили модель Being-H0.8, которая объединяет зрение, осязание, действия и предсказание изменений в одном скрытом пространстве. По оценке Лу Цзунцина, через 3–5 лет возможно создание базового моделированного тела на уровне GPT 3.5.

Being-H0.8: модель скрытого пространства от BeingBeyond

Лу Цзунцин, приглашённый доцент факультета компьютерных наук Пекинского университета, — один из первых исследователей, кто сделал ставку на данные с внутреннего первого взгляда. Ранее он занимал должность старшего председателя в ICML, NeurIPS, ICLR. В июне 2025 года на «» Лу Цзунцин заявил, что человеческие видео — единственный путь масштабирования для воплощённого интеллекта. На данный момент собрано более 500 тысяч часов таких данных — каждый час отфильтрован по стандартам разнообразия и качества.

В 2025 году Лу Цзунцин основал компанию BeingBeyond. Она развивает модель скрытых мировых действий (Latent World-Action Model): в embedding space совместно предсказывает, что сделает робот и как отреагирует мир. Затраты на обучение составляют около 1 % от затрат на пути генерации видео, а скорость вывода позволяет реализовать управление в реальном времени.

28 июля 2026 года BeingBeyond выпустила Being-H0.8 — первый в мире скрытый тактильный мировой модельный агент. Being-H0.8 впервые включил тактильный модальный режим в крупномасштабное предварительное обучение модели и объединил зрение, осязание, действия и будущие изменения состояния в одном скрытом пространстве (latent space). Это позволяет роботу не только фиксировать то, что он «увидел, сделал, коснулся», но и понимать, какие изменения произошли в мире. В результате робот получает более полное представление о ситуации и может прогнозировать физические взаимодействия.

Лу Цзунцин считает, что определяющие технологии для базовых моделей воплощённого интеллекта ещё не появились. Он отмечает, что успех GPT стал возможен благодаря существованию Transformer и Next Token Prediction — то есть благодаря наличию определённой парадигмы, без которой накопление данных не имеет смысла. В области воплощённого интеллекта пока даже не ясно, что такое определяющая технология.

Учёные, запускающие стартапы в сфере ИИ, испытывают чувство срочности, особенно в области автономного вождения. Цель команды — создать embodied foundation model. Однако в учебных заведениях недостаточно ресурсов (вычислительных мощностей, кадров, промышленной экосистемы) для этой задачи.

На китайском рынке капитала преобладает краткосрочный подход. Например, в клубных сделках (Club Deal) первые раунды финансирования часто не раскрываются, а оценки компаний доходят до 500 млн долларов. Команда BeingBeyond ищет долгосрочных инвесторов: для проектов, результат которых проявится через 3–5 лет, нужны соответствующие по срокам инвестиции — краткосрочное финансирование может исказить технические решения.

Понятие «модель мира» (world model) не имеет чёткого определения и реализуется в разных областях: в лингвистике — языковой моделью, в 3D‑генерации (команда Ли Фэйфэя), в генерации видео. Нет единой модели, способной одновременно выводить текст, генерировать 3D‑пространство, видео и управлять роботом. Для embodied‑систем embodied foundation model — это и есть модель мира в этой области.

Существуют два основных направления в рамках embodied:
1. На основе моделей генерации видео: дообучение существующих моделей, генерация видео с одновременным выводом действий.
2. Без генерации изображения: предсказание следующего состояния и действий в пространстве вложений (embedding space).

Ли Фэйфэй классифицирует подходы по применению: генерация рендеринга 3D‑пространства, симуляционные интерактивные системы, управление роботами. Cosmos Policy от NVIDIA относится к последнему направлению.

Ключевой выбор — backbone, поскольку он определяет стоимость обучения, скорость развёртывания и возможность работы на реальном оборудовании.

У направления генерации видео есть два недостатка:
- очень высокая стоимость обучения;
- крупные видеогенерационные модели требуют для предобучения нескольких десятков тысяч карт, нескольких месяцев и затрат в несколько сотен миллионов.

Модель команды Али Wan застряла на версии 2.2 и не работает на реальных устройствах. Для роботов важна высокая скорость вывода: нужно быстро определять траекторию полёта мяча и выполнять действия.

Преимущество подхода с использованием скрытого пространства (latent space) — низкая стоимость вычислений (около 1 % от стоимости моделей, генерирующих в пиксельном пространстве) и более лёгкое выявление физических и причинно-следственных связей.

Лу Цзунцин считает, что демонстрация и практическое применение — разные вещи: для робота важнее функциональность, а не качество видео. Скрытое пространство сложно демонстрировать, но оно ближе к промышленности и имеет чёткие цели.

В ноябре 2023 года Лу Цзунцин высказался о важности данных с первого лица (от человека). Данные от роботов имеют ограничения по объёму и разнообразию, симуляции тоже недостаточно разнообразны. Видео с первого лица от людей сочетает высокое разнообразие, большой объём данных и возможность масштабирования.

Для создания 500 тысяч часов данных требуется мощная инфраструктура: разметка, отбор, выравнивание данных, оценка, управление данными. «» завершила строительство всей инфраструктуры — от конвейера данных, предварительного обучения модели, последующего обучения, оценки до развёртывания на стороне терминала. Эта система способствует накоплению масштабируемых данных и развитию возможностей модели.

Модель Being-H0.5 может адаптироваться к двуногим гуманоидным роботам, двуруким, манипуляторам, захватам, ловким рукам: после тонкой настройки на данных одного типа конструкции робот другого типа может выполнять аналогичные действия.

Ловкие руки стоимостью 50 тысяч долларов можно продавать только богатым научным учреждениям — рынок очень мал. Дешёвые руки имеют больший объём, но снижение себестоимости при массовом производстве возможно только при наличии большого реального спроса. Сейчас спрос ограничен из‑за недостаточного развития моделей.

Компания фокусируется на операционных задачах: гуманоидные роботы, манипуляторы, ловкие руки. Идёт сотрудничество с «» по развёртыванию моделей на стороне терминала. Предполагается, что в сфере автономных систем сформируется отраслевая специализация, и разные компании будут заниматься разными задачами — это ускорит развитие отрасли.

Лу Цзунцин считает свою команду одной из первых в Китае, кто системно развивает модели действий в скрытом пространстве мира. По его оценке, через 2–3 года в отрасли появятся реально коммерциализированные сценарии с расчётом ROI. Через 3–5 лет возможно создание базового моделированного тела на уровне GPT 3.5 — способного выполнять различные задачи в разных условиях без обширной адаптации под сценарии. Это станет ключом к появлению домашних роботов и обеспечит более высокую коммерческую ценность.

H0.7 и H0.8 — промежуточные версии модели. H0.8 знаменует важный этап — эволюцию от визуального восприятия к пониманию взаимодействия. Модель предполагает наличие способностей к визуальному восприятию, тактильному взаимодействию, генерации действий, предсказанию мира, кросс‑онтологической обобщённости. Цель — версия 1.0, представляющая собой полноценный универсальный базовый моделированный тело.

<<<CODE_BLOCK_N>>>
<<<IMG_N>>>

// оригинал
Leiphone ↗ Читать оригинал
4 просмотров
// поделиться Telegram VK