NVIDIA представляет Cosmos 3 — базовую мировую модель на единой архитектуре Transformer, которая объединяет текст, видео, аудио и действия. Как пишет автор , Cosmos 3 рассматривается как «Android-система» эпохи воплощённого интеллекта (RSS 2026). Модель знаменует переход от эпохи «сборочных машин», когда разработчикам нужно было собирать визуальные модели, языковые модели и алгоритмы управления, к эпохе «целостной интеграции».
В 2026 году в индустрии больших моделей наблюдается «перемещение ощущений»: закон масштабирования (Scaling Law) сталкивается с физическими законами, пространственными ограничениями и данными с длинным хвостом при переходе в физический мир. Есть разрыв между экспоненциальным ростом облачных вычислительных мощностей и медленным внедрением роботов.
Эксперт по физическому ИИ Nvidia Макс Ли представил Cosmos 3 на воркшопе Robot World Models в последний день RSS 2026 в Сиднее. Там произошло столкновение подходов: традиционное сообщество робототехники уважает физическую причинность, а индустрия ИИ верит в эффект масштаба.
Nvidia стремится стать не только монополистом в области аппаратного обеспечения, но и «Android-системой» эпохи воплощённого ИИ — через стандартизацию протокола «мозг и тело». Это позволит различным роботам эволюционировать на основе логики Cosmos. Следующая фаза воплощённого ИИ будет связана не с дата‑центрами, а с периферийными устройствами — AGI будет работать в реальном времени на периферийных устройствах типа Jetson.
Основная проблема в физическом ИИ — данные: их получение из физического мира ограничено временными и пространственными факторами. Нельзя полностью решить проблему только за счёт удалённого управления или синтетических данных — нужны более фундаментальные технологии. Поэтому вводится концепция базовой мировой модели (World Foundation Model) как основы для приложений физического ИИ.
Ключевые способности базовой модели:
* понимание мира (понимание текущего состояния среды);
* моделирование последствий (предсказание результатов действий);
* выполнение действий (реализация намерений в реальном мире).
Cosmos 3 интегрирует все модальности (текст, изображение, видео, аудио, действия) и генерирует их. Модель может анализировать видео с выполнением задач роботом (как VLM): определять последовательность событий и делать прогнозы. Осуществлено совместное моделирование аудио, видео и действий. Аудио включено в обучение базовой модели, так как многие подсказки в физическом взаимодействии (например, столкновения, трение) передаются через звук.
Пример симуляции Cosmos — моделирование взаимодействия человека с миром: траектория движения камеры шлема, поза руки, процесс нагревания предмета и его размещения на столе. Считается, что данные с первого лица (Ego-centric) — наиболее эффективный способ получения знаний о физическом взаимодействии для базовых моделей.
Реализована обратная динамика (Inverse Dynamics): не только предсказание визуальных наблюдений на основе действий, но и обратный вывод базовых действий из многовидовых наблюдений. Модель может преобразовываться в стратегическую модель (Policy Model) и выполнять действия в реальном мире после достаточного моделирования физических результатов (динамика, эволюция видео, понимание текста). Показан пример использования предсказанных действий для управления URDF‑моделью робота (перемещение робота вперёд).
В Cosmos представлены разные версии моделей:
* Cosmos Edge — для периферийных устройств. Позволяет реализовать реальное время вывода на устройствах типа Jetson без GPU серверного уровня. При обучении Edge‑модели исключён аудиомодуль, так как он не обязателен для большинства задач на устройстве и позволяет сэкономить ресурсы.
* Super‑серия — для серверной части.
Осуществлено сотрудничество с Pi‑командой для демонстрации возможности офлайн‑оценки стратегии (Policy Evaluation).
Архитектура модели разделена на две части:
* Reasoner (понимает мир, аналог VLM);
* Generator (отвечает за мультимодальный вывод: видео, аудио, действия) — архитектура MoE.
При понимании мира используется причинное самовнимание (Causal), при генерации — двунаправленное внимание (Bi‑directional). Поддерживаются разные воплощения (Embodiments): AV (автомобиль), первое лицо (движение камеры), однорукий робот, двурукий робот, гуманоидный робот. Действия векторизуются с помощью эвристических правил.
Три режима обучения:
* Dynamics Mode: по действию предсказать будущее видео;
* Inverse Dynamics Mode: по видео предсказать действия, которые его вызвали;
* Policy Mode: совместное обучение по видео и действиям.
Для унификации кодирования позиций (Position Embeddings) в разных модальностях:
* язык: стандартный подход;
* видео: инкрементные индексы по P, H, W (3D пространство);
* аудио и действия: только временная ось.
Для синхронизации видео, аудио и действий выбран стандарт 24 FPS; при вводе видео с другой частотой кадров индексы пересчитываются на основе 24 FPS.
В ходе предобучения отобрано около 2200 млн обучающих образцов, охватывающих OCR, визуальное позиционирование и другие области. На этапе SFT выделен поднабор образцов для физического ИИ. На стороне генератора — около 220 млн образцов. Обучение проходит в три этапа:
1. Предобучение: генерация изображений, видео, преобразование изображения в видео (I‑to‑V); объём данных — около 1000 млн часов видео.
2. Средний этап обучения (Me‑training): добавлены дополнительные модальности (в том числе действия), использованы данные междоменного переноса, включая симуляционные видео с рендерингом до фотореалистичного уровня без изменения физических свойств.
3. Постобучение (Post‑training): обучены версии Nano и Super — для задач «текст‑изображение», «текст‑видео», «изображение‑видео», а также для вывода стратегии.
Семейство моделей Cosmos:
* Cosmos Edge — MoE‑модель с 4B (40 млрд) параметрами, включает два эксперта (по 2B каждый);
* Cosmos Nano — MoE‑модель с 16B параметрами (по 8B для распознавателя и генератора);
* Cosmos Super — MoE‑модель с 64B параметрами (по 32B), предназначена для разных сценариев применения.
Выявлена чёткая закономерность масштабирования (Scaling Law): более крупные модели имеют явное преимущество в генерации изображений и видео. Cosmos — полностью открытая модель. Над проектом работали более 100 человек. Автор лично отвечает на Issues в GitHub.
Макс Ли обсуждает подход к обучению модели Cosmos: на этапе предобучения (Cosmos) не используются данные о PID‑контроле, модель обучается как State Transition Machine; контрольные сигналы вводятся на этапе постобучения (Post‑training), что делает модель практичной. Для оценки точности Cosmos в отношении физических законов применяются бенчмарки, например VBench. В области робототехники и воплощённого ИИ введение данных об действиях существенно повысило точность прогнозирования будущего визуального движения.
Также упоминается предстоящее событие RSS 2026 и приглашение в группу для обсуждения AI‑исследований (контакты: сканирование QR‑кода или добавление в WhatsApp Luyoyo_2026, комментарий « + AI »). Есть возможность просмотра материалов с ведущих мировых конференций по ИИ: выступления экспертов, PPT, полные отчёты, разбор популярных статей, интервью с новыми звёздами науки. Для доступа нужно отсканировать QR‑код или нажать «чтение оригинала», подписаться на «» (публичный аккаунт:).
:RSS:,