В 2026 году мир моделей вступает в эпоху лидерства Китая — и ключевой игрок в этой сфере, компания «Куньлунь Ванвэй», представляет модель Matrix-Game 3.5. Она призвана вывести технологии за пределы игр — к управлению роботами и взаимодействию с физическим миром.
Компания уже выпустила пять моделей: Matrix-Zero, 1.0, 2.0, 3.0 и 3.5. Каждая из них превосходит предыдущую. Хронология развития выглядит так:
* 2022 год: объявлено «All in AGI AIGC»;
* 2024 год: Matrix-Zero начала системное исследование пространственного интеллекта;
* 2025 год: выпущены Matrix-Game 1.0 и 2.0;
* 2026 год: выпущены Matrix-Game 3.0 и 3.5.
19 июля 2026 года на WAIC прошёл организованный «Куньлунь Ванвэй» форум «Мир моделей и революция мультимодальных парадигм». Компания объявила, что 2026 год станет годом мировых моделей.
Одна из главных проблем современных моделей — так называемое «физическое сохранение»: способность отслеживать объекты, когда они покидают поле зрения. Существует оценочный бенчмарк MemoBench (разработан Гарвардом, MIT, IBM, Google), который проверяет эту способность. Большинство ведущих мировых моделей не прошли этот тест: максимальный балл — 0,58 из 1.
Проблема «сохранения объектов» состоит из трёх частей:
* неспособность поддерживать непрерывное представление об идентичности объекта («не помнят»);
* неспособность точно идентифицировать объект при его повторном появлении («не распознают»);
* неспособность правильно воспроизвести изменения состояния объекта во время его отсутствия («неверно преобразуют»).
Matrix-Game 3.5 решает эти проблемы. Модель переходит от распознавания пикселей к распознаванию пространства. Для этого реализованы следующие решения:
* система Patch‑уровневой долгосрочной памяти с геометрическим выравниванием: память переключается с временной индексации на пространственную, исторические наблюдения представлены в виде трёхмерного Patch Memory;
* PRoPE — кодирование матрицы проекции камеры в пространственно‑временные координаты;
* Warped RoPE — определение координат патча в трёхмерном пространстве в текущем ракурсе;
* разделение памяти на Patch Memory (для статической структуры сцены) и Token (для динамических объектов).
Кроме того, Matrix-Game 3.5 внедряет причинно‑следственный вывод в цель обучения: объединяет прогнозирование состояния и генерацию действий в рамках одной функции потерь. Эксперименты подтвердили значительное улучшение способности модели понимать состояние и предсказывать действия.
Ещё одна проблема — нехватка данных для обучения моделей. «Куньлунь Ванвэй» разработала тяжёлое решение для автоматической реконструкции физического масштаба видеоданных: три автоматизированные линии обработки данных.
* Первая — система с несколькими агентами для изучения тысяч игр и отбора ценных источников данных.
* Вторая — автоматизированная линия офлайн‑аннотирования для оценки положения камеры, метрической глубины и внутренних параметров камеры в видео.
* Третья — система оценки качества сцены (Scene‑Quality), оценивающая данные по геометрической возможности восстановления и ценности для обучения.
Результаты впечатляют: более 5 млн высококачественных видеофрагментов, более 10 тыс. эффективных часов обучения, охват более 1200 игровых и реальных физических сцен. Благодаря физическому масштабу модель впервые может понимать расстояние и скорость в пространстве.
Также Matrix-Game 3.5 решает проблему задержки в сценариях управления роботами. Для максимизации вывода используются три метода:
* 3‑шаговый отбор с дистилляцией (сокращение количества шагов шумоподавления с десятков до 3 без потери качества изображения);
* оптимизация вывода DiT (квантование FFN INT8 для сжатия весов, использование KV Cache для кэширования уже сгенерированных пар ключ‑значение);
* MG‑LightVAE для обрезки (структурная обрезка видеокодера примерно на 75 % для облегчения кодирования и декодирования).
В результате модель с 5 млрд параметров на одной GPU обеспечивает генерацию в реальном времени с разрешением 720p и примерно 20 FPS.
Ещё один важный аспект — вычислительные мощности. Обработка непрерывного видеопотока требует гораздо больших вычислительных затрат, чем обработка дискретных последовательностей токенов в больших языковых моделях. Matrix-Game 3.5 достигла прорыва: почти без добавления новых параметров (за исключением Reference Adapter) можно реализовать моделирование интерактивного мира и быстро адаптировать его к различным базовым видеомоделям.
Matrix-Game 3.5 — первый движок с причинным рассуждением и способностью к действиям. Её цель — выдача исполняемых физических управляющих инструкций: модель обучается предсказывать причинно‑следственные цепочки «действие → изменение мира». Это позволит обучать роботов без миллионов проб и ошибок в реальном мире (затраты сводятся к оплате токенов), а также генерировать сценарии для симуляции автономного вождения (дождь, ночь, неожиданные ситуации) без дорогостоящих закрытых тестовых площадок и риска аварий.
Серия моделей Matrix-Game получила поддержку академических и индустриальных лидеров. Модели Matrix-Game используются как эталон для сравнения в работах NVIDIA SANA-WM, Adobe RELIC и других.
«Куньлунь Ванвэй» придерживается политики «одна публикация — одно открытие исходного кода». Например:
* май 2025 года: открыт Matrix-Game (первый в промышленности пространственный ИИ‑модель размером более 10B);
* через три месяца после этого на мероприятии SkyWork AI представлено 5 моделей, среди них Matrix-Game 2.0 — первое в отрасли открытое решение для интерактивного создания длинных последовательностей в общих сценариях (ссылка на статью: ссылка на проект:);
* март 2026 года: Matrix-Game 3.0 впервые системно включила проблему памяти в открытое решение.
На основе Matrix-Game 2.0 профессор Нью‑Йоркского университета Се Се (совместно с Yann LeCun работавший над JEPA) создал первый в мире многопользовательский видеомодель Solaris.
NVIDIA и Чжэцзянский университет на основе Matrix-Game 3.0 совместно выпустили работу по мировым моделям Light Interaction.
В марте 2026 года «Куньлунь Ванвэй» представит «4+3» AGI‑стратегию: четыре модельных базиса (видеомодель, музыкальная/аудиомодель, мировая модель, базовая текстовая и мультимодальная модель) и три экономических платформы (AI‑короткометражки, AI‑музыка, AI‑игры). Мировая модель выступит в роли базового движка всей экосистемы. Платформы будут генерировать данные (игровые — интерактивные данные, видео — обучающие материалы, музыкальные — обогащают перцептивные измерения), которые поступят в модели. Способности моделей улучшат пользовательский опыт платформ, что привлечёт больше пользователей и создаст больше данных — сформируется замкнутая система «модель — платформа — данные».
Для сравнения: Google Genie 3 может поддерживать согласованность только около одной минуты. Его авторегрессионная архитектура генерирует последовательные кадры, но ограничена временным окном памяти — после этого ошибки накапливаются и сцена разрушается.
<<<CODE_BLOCK_N>>>
<<<IMG_N>>>