DeepDigest
Leiphone · · ~5 мин

MiniMax H3 и Seedance 2.0 Fast: восстановление процесса разрушения по изображению

Проведено тестирование моделей MiniMax H3 и Seedance 2.0 Fast для восстановления процесса разрушения по изображению осколка керамического сосуда. Seedance 2.0 Fast показала более высокую скорость генерации, реалистичность и чёткость отображения физического процесса. H3 продемонстрировала способность генерировать видео на основе изображения и текста, но нуждается в улучшении в части реализма и деталей.

MiniMax H3 и Seedance 2.0 Fast: восстановление процесса разрушения по изображению

Можно ли с помощью искусственного интеллекта восстановить процесс разрушения по изображению осколка керамического сосуда? Чтобы ответить на этот вопрос, провели тестирование двух моделей — MiniMax H3 и Seedance 2.0 Fast. Автор тестирования — Ли На, дата проведения — 1 сентября 2026 года.

MiniMax открыла доступ к весам модели H3 — это важный шаг для индустрии видеогенерации: часть возможностей теперь доступна в локальной среде. H3 — многомодальная генеративная модель: она обрабатывает текст, изображения, видео и аудио в единой среде. Особенность H3 — совместная генерация изображения и звука, а не последовательная (сначала видео, потом озвучка). Это позволяет синхронизировать движения, столкновения объектов и звуки окружения на одной временной шкале.

В рамках теста модели H3 предоставили опорное изображение разбитого сосуда и детальное описание элементов (окно, кошка, подставка, падение, удар, разлетевшиеся осколки) для генерации видео. В качестве референса использовался скриншот из «» #1178 «» с фрагментированным керамическим горшком: коричневый керамический материал, светлые края разломов, осколки на серой поверхности, линии, тени и низкая насыщенность цветов в анимационном стиле. При этом требовалось, чтобы H3 сгенерировала процесс разрушения горшка — от целого состояния до разбитого, игнорируя субтитры, водяные знаки и логотипы платформы.

Тест выполнялся на сервере с GPU NVIDIA RTX A6000 с использованием ComfyUI в качестве фреймворка. Процесс развёртывания включал несколько шагов: загрузку весов модели H3 из сообщества «моста», размещение файлов в каталоге моделей ComfyUI, установку среды выполнения ComfyUI, настройку зависимостей Python, компонентов ускорения CUDA и необходимых узлов, запуск сервиса ComfyUI и доступ к интерфейсу рабочего процесса в браузере.

H3 в основном следует нарративу: кошка входит в комнату и разбивает горшок. Видео начинается с демонстрации интерьера, где находится горшок, затем показывает, как кошка входит и приближается к подставке, что приводит к нарушению равновесия, падению и разрушению горшка. В финале кадры концентрируются на крупных осколках на полу. Материал осколков, светлые края разломов и анимационный стиль с низкой насыщенностью цветов соответствуют референсу. H3 решает задачу обеспечения временной согласованности при генерации видео: сохраняет характеристики объекта в разных кадрах и отображает его изменения (от целого до разбитого). Ключевые технологии H3 — многомодальное единое моделирование (понимание текста, изображения, видео, аудио), управление с опорой на эталонное изображение (извлечение ключевых визуальных ограничений), синхронизация действий, изображения и звука. Модель поддерживает рабочий процесс reference-to-video/audio: референс-изображение может задавать основу, стиль, материал или конечное состояние. В этом задании скриншот с разбитым горшком задаёт конечное состояние (цвет керамики, светлые края разломов, форма осколков и компоновка на полу), а текстовые инструкции описывают процесс (кошка входит, ударяет по горшку, горшок падает и разбивается). Модель совмещает конечное состояние из изображения и описание процесса из текста в единую временную линию, создавая визуально и аудиально согласованный путь изменений.

Тем не менее у H3 есть недостатки: неточное звуковое сопровождение в начале видео (звуки не соответствуют движениям на экране) и недостаточное отображение момента, когда кошка покидает место происшествия по завершении события. Кроме того, модель нечётко показывает ключевые моменты контакта кота и сосуда, из‑за чего причинно‑следственная связь выглядит размыто. H3 демонстрирует событие фрагментации горшка через нарратив в кадрах, но не показывает достаточно детально, как горшок разрушается в реальных условиях нагрузки.

Параллельно проводилось тестирование Seedance 2.0 Fast — модель сравнивали с H3, используя одно эталонное изображение и одни инструкции. Скорость генерации у Seedance 2.0 Fast составила 3 минуты 23 секунды для 10‑секундного видео, а у H3 — 54 минуты 4 секунды. Разница в скорости может быть связана с устаревшим GPU, средой вывода и недостаточной оптимизацией в случае H3. Стоимость генерации у Seedance 2.0 Fast — 0,60 юаня за секунду (10‑секундное видео — 6 юаней). Затраты на H3 не тарифицируются по секундам, они связаны с электроэнергией, износом оборудования и временем ожидания.

Seedance 2.0 Fast демонстрирует более высокую завершённость видео: более плавные переходы между кадрами, богаче сценарная информация, чётче показан процесс события (от среды мастерской до разбитого сосуда). В плане реалистичности Seedance 2.0 Fast ближе к стилю документальной съёмки: низкая насыщенность, сильное соотношение света, реалистичные элементы пространства, освещения и материалов. В плане физического моделирования Seedance 2.0 Fast лучше передаёт процесс падения и разрушения сосуда: более полная последовательность событий, убедительные визуальные характеристики веса, направления падения и движения осколков. При этом в видео, сгенерированном Seedance 2.0 Fast, движения кошки выглядят нарочитыми, отсутствует случайность и естественность, характерные для поведения животных.

Сравнение моделей с открытым и закрытым исходным кодом выявило различия в подходах: открытые модели делают акцент на развёртывании, изучении и контролируемости, закрытые — на платформенной оптимизации и быстром получении высококачественных результатов. H3 частично открывает возможности генерации видео для сообщества, позволяя разворачивать и тестировать модель локально, однако не является полностью открытым решением — некоторые модули не открыты, для проверки полных возможностей предлагается API. Локальная версия с открытым исходным кодом может отличаться по качеству и скорости генерации от версии с использованием API.

Таким образом, Seedance 2.0 Fast превосходит в скорости генерации, реалистичности изображения, непрерывности кадров и чётком отображении физического процесса разрушения горшка. H3 показывает способность генерировать видео на основе результирующего изображения и текста, но при локальном развёртывании имеет проблемы с длительностью генерации, анимационным стилем, недостаточной чёткостью ключевых действий и неточностью аудиовизуальных деталей. H3 значима как платформа для локальных исследований, мультимодальной аудиовизуальной генерации и обратного вывода процесса по результату. Seedance 2.0 Fast демонстрирует зрелость коммерческих моделей в оптимизации, реализме и стабильности физического моделирования. Видеомодели уже могут расширять «результирующее изображение» до «видеопроцесса», но для надёжного восстановления физических аварий требуется решить вопросы причинно-следственных связей действий, логики нагрузок, движения осколков и синхронизации аудио и видео.

// оригинал
Leiphone ↗ Читать оригинал
4 просмотров
// поделиться Telegram VK