18 июля 2026 года на WAIC прошёл форум «基座大模型架构创新与生态合作论坛», организованный компанией Шантан (商汤科技). Шеф‑научный сотрудник компании Линда Хуа в беседе с «AI科技评论» отметила, что большие языковые модели сталкиваются с границей при взаимодействии с физическим миром: язык не способен точно передать визуальные детали — например, описать расположение листьев на растении. По мнению Линды Хуа, визуальное взаимодействие — незаменимый элемент в человеко‑машинном взаимодействии, поскольку визуал ориентирован на человеческий опыт, а CLI — на машины.
Шантан делает ставку на мультимодальность — интеграцию языка и зрения. В марте 2026 года компания выпустила мультимодальную архитектуру NEO‑unify, а в апреле опубликовала и открыла исходный код мультимодальной модели SenseNova U1 (U1). На конференции Шантан представила модель SenseNova U1 Pro (U1 Pro) — первый в мире мультимодальный инструмент с принципом «понимание, генерация, действие». Модель способна выводить изображения в качестве 8K и конкурирует с такими моделями, как GPT‑Image‑2.
В основе работы NEO‑unify лежит архитектура Mixture‑of‑Transformers (MoT). В этой архитектуре Шантан полностью удалила визуальный кодировщик и вариационный автокодировщик, которые обычно используются в крупных моделях: теперь модель учится напрямую на пикселях и тексте. NEO‑unify обеспечивает глубокое слияние языковой и визуальной информации на каждом уровне вычислений. Для достижения высокого уровня визуального восприятия и рассуждений модели требуется 3,9 млрд примеров изображений и текста — это примерно 1/10 от объёма данных, необходимого аналогичным моделям.
SenseNova U1 — открытая версия, основанная на архитектуре NEO‑unify. Модель обладает «цепочкой мыслей с чередованием текста и изображений», обеспечивает высокую согласованность изображений и текста по стилю и логике. Версия U1 (объём 8B) достигает SOTA‑производительности: некоторые показатели сопоставимы с ведущими крупными закрытыми моделями.
Разработан ряд версий для создания инфографики:
* infographic‑V1: полная переработка базовой вычислительной архитектуры, значительное улучшение плотности информации и качества вёрстки;
* infographic‑V2: решение проблемы размытия изображений при большом количестве текста и ошибок, существенное повышение чёткости мелкого текста и точности вёрстки;
* infographic‑V3: добавлена функция редактирования — пользователь может выбирать и напрямую изменять элементы изображения.
Для обучения U1 Pro создан мультимодальный набор данных размером более 100 млн, приближающийся к миллиардному объёму. В нём текстовые описания и требования к дизайну часто достигают тысячи слов. Процесс обучения U1 Pro включает три этапа:
1. Предварительное обучение: обработка нескольких миллиардов исходных данных с чередованием текста и изображений.
2. Продолжительное предварительное обучение: интенсивное использование синтетических данных для повышения профессиональных дизайнерских способностей модели. Синтетические данные создаются с помощью сложной автоматизированной системы синтеза данных, управляемой супер‑агентами.
3. Пост‑обучение: отбор миллионов качественных данных для доработки модели и достижения готового качества поставки.
U1 Pro решает ключевые проблемы коммерциализации ИИ‑дизайна:
* неточное понимание требований;
* шаблонные решения, создающие ощущение разрозненности (отсутствие единой эстетики);
* неспособность модели выстраивать причинно‑следственные связи между элементами дизайна.
Критерием качества модели является уровень сдачи работ (content delivery rate) — возможность прямой коммерческой эксплуатации без существенных правок. Уровень сдачи U1 Pro стабильно составляет 70 %. Только две мультимодальные модели превышают порог в 60 % (уровень для коммерческой сдачи): U1 Pro и GPT‑Image‑2 от OpenAI. 70 % уровня сдачи достигается за счёт строгого контроля качества: частота ошибок в тексте и в графических элементах, компоновке и цветовых сочетаниях — на уровне промилле.
Секрет высокой сдачи U1 Pro — в «цепочке визуального анализа» (视觉拆解思维链): модель анализирует высококачественный плакат, раскладывает его на визуальные компоненты, восстанавливает логику компоновки и выбора цветов, формирует полную цепочку дизайнерского мышления. U1 Pro использует многоэтапный цикл генерации изображений: сначала анализирует текст и планирует макет, затем генерирует изображение, после чего проводит самопроверку (поиск ошибок в тексте, недочётов в макете и эстетических проблем) и итеративно исправляет недочёты до соответствия стандартам.
Для доработки эстетики компания Шантан создала «человеческую команду по оценке эстетики» из 200 студентов художественных вузов и профессиональных дизайнеров — они анализируют и оценивают работы, сгенерированные U1 Pro. U1 Pro обладает элементами пространственного моделирования — например, может «играть» в кубик Рубика.
В рамках стратегии «1+X» компания Шантан развила экосистемное предприятие — робота Дасяо (大晓), который представил модель «Кайу» («开悟»). Модель объединяет понимание, генерацию и прогнозирование; в её основе — мультимодальная платформа, объединяющая визуальное и языковое восприятие, при этом в обучении преобладает данных о телесном восприятии.
13 июля Шантан выпустила визуальный большой модель SenseNova‑Vision. Цель модели — сделать визуальное восприятие базовой способностью универсальной модели. SenseNova‑Vision способна выполнять задачи, ранее требовавшие специализированных моделей (обнаружение объектов, сегментация изображений, прогнозирование глубины, 3D‑реконструкция).
Следующая версия — U2 — будет работать с видео (понимание и генерация), объединяя восприятие, понимание, генерацию и действие. В перспективе модель сможет по чертежу создать целое здание. Конечная цель — расширение модальностей от визуального и языкового восприятия до сигналов от десятков датчиков. Сложность реализации связана с комплексностью физических законов; в будущем потребуется учитывать и социальные аспекты. С ростом числа физических параметров количество комбинаций данных будет расти экспоненциально, что создаст ограничения по вычислительным мощностям и объёму хранения данных.
Линда Хуа предлагает решать проблему путём декомпозиции свойств мира — создания специализированных подмоделей для разных свойств, которые будут комбинироваться и совместно рассуждать, вместо попытки обработать все возможные комбинации данных. Цель команды — создать AGI, работающий в физическом мире.
Кроме того, компания Anthropic в версии Opus 4.8 усилила мультимодальные элементы. Текущая основная технологическая линия в области мультимодальных больших моделей — «сборочная архитектура»: к зрелой языковой большой модели добавляется независимый визуальный кодировщик (VE) и другие модули. Суть подхода — сначала «перевести» изображение в текст, затем передать на обработку языковой модели. Такой подход имеет низкий порог входа и быструю скорость обучения, но низкий технический потолок: в процессе «перевода» теряется много детальной информации, эффективность слияния визуала и языка низкая.
Команда Линды Хуа в середине 2025 года совместно с S‑Lab Наньянского технологического университета (南洋理工大学S‑Lab) проверила на небольших данных идею изначального слияния. В сентябре 2025 года команда опубликовала статью Towards Native Vision‑Language Primitives at Scale, где впервые в академической среде систематически описала полностью удалённую визуальную кодировку и построение глубокой интеграции изначальной мультимодальной архитектуры NEO. В марте 2026 года Шантан выпустила обновлённую версию фреймворка — изначальную унифицированную архитектуру NEO‑unify и статью NEO‑unify: Building Native Multimodal Unified Models End to End, в которой изложила концепцию создания сквозной изначальной унифицированной модели.
По данным Precedence Research, к 2026 году объём глобального рынка генеративного ИИ в дизайне составит около 13,3 млрд долларов. Крупные предприятия обеспечивают более 47 % рынка. Шантан выбрала направление дизайна (в том числе информационных графиков) как ключевой для мультимодальной стратегии — особенно перспективно для B2B‑сегмента (электроника, реклама, игры, внешняя торговля). Линда Хуа считает, что компания будет долго инвестировать в направления с большим потенциалом, даже если они не в центре общественного внимания.