DeepDigest
Leiphone · · ~4 мин

H3 от MiniMax: открытая мультимодальная модель для видеогенерации

MiniMax выпустила открытую мультимодальную модель H3 для генерации и редактирования видео. Её стоимость составляет треть от цены Seedance 2.0, а эффективность сопоставима с ним. Модель ориентирована на реальные производственные сценарии и открывает новые возможности для разработчиков и предприятий.

H3 от MiniMax: открытая мультимодальная модель для видеогенерации

Компания MiniMax представила видеомодель H3 — первую открытую мультимодальную модель уровня флагмана. Её стоимость составляет треть от цены Seedance 2.0, а эффективность сопоставима с этим решением. H3 объединяет текст, картинки, аудио и видео в одном контексте и выполняет множество задач: от понимания сценария и генерации кадров до синхронизации звука и изображения, добавления субтитров, брендинговых текстов, переходов и локального редактирования.

В рейтинге Artificial Analysis H3 занимает первое место с 1130 Elo, опережая Google Gemini Omni и Seedance 2.0. Среди особенностей модели — возможность редактирования существующих видео (замена людей, предметов, фона, зелёное экранирование, изменение диалогов, регулировка освещения и продолжение видео), поддержание стабильности текста в последовательных кадрах и интеграция генерации изображения, звука, текста и ритма кадров в одной модели. Пользователь получает готовый видеофрагмент без дополнительной постобработки.

Пример промпта для H3: сцена с двумя магами, меняющими цвет костюмов при помощи магии. H3 демонстрирует высокую успешность выполнения таких задач по сравнению с Seedance.

Модель использует язык как основу для обобщения и включает возможности в единую схему предварительного обучения. Так, text-to-video может генерировать одновременно изображение и аудио, а звук не разделяется на голос, эффекты и музыку. Работа с референсами и редактированием осуществляется через описание на естественном языке.

H3 опирается на четыре ключевые технологии:
1. Contextual Omni Representation — усиливает возможности многомодального Caption, помогает понимать взаимосвязи между материалами, изображением и звуком.
2. H3-VAE — модернизирует видеотокенизатор, повышает качество восстановления и эффективность сжатия. Заявлено увеличение длины последовательности в 4 раза — это ключ к поддержке нативного вывода 2K.
3. H3-Omni Transformer — архитектура обучения с разделением понимания и генерации, балансировка нагрузки между выборками, увеличение пропускной способности сквозного обучения почти на 30 %.
4. In-context Regeneration — базовое моделирование заново генерирует детали 2K на основе результатов с низким разрешением и контекстной информации, улучшая воспроизведение мелких текстов, текстур и деталей изображения.

H3 ориентирован на реальные производственные сценарии и коммерческую доставку готовых видео. Модель тестирует ключевые аспекты коммерческого видеопроизводства: стабильность текста, точное отображение брендовой информации, ритм между кадрами, синхронизацию звука и изображения, целостность готового продукта. Например, в тестах разработчика @hasantoxr H3 добавляет рисованные светящиеся анимации к реальным видео по текстовым описаниям, согласовывая их с освещением сцены и сохраняя реальные светотеневые отношения.

Открытие H3 даёт компаниям возможность развёртывать модель на собственных серверах или в частном облаке. Это позволяет сохранить внутри системы данные (например, базу товаров электронной коммерции, активы персонажей игровых компаний, образы актёров и материалы сцен для коротких сериалов) и контролировать безопасность данных, интеллектуальную собственность и производственные процессы. На основе H3 можно выполнять тонкую настройку, адаптацию и вторичную разработку — создавать отраслевые версии модели, которые лучше понимают товары, персонажей, активы бренда или язык кадров, встраивать модель в инструменты редактирования и платформы для творчества.

Эволюция инструментов для создания визуального контента прошла путь от профессионального ПО (Photoshop, After Effects, Premiere, DaVinci Resolve) через AI‑вспомогательные инструменты (автоматическое вырезание, интеллектуальное редактирование, дорисовка кадров, распознавание и заполнение контента) к моделям генерации изображений (Midjourney, Stable Diffusion) и видео. Stable Diffusion с открытым исходным кодом сыграла ключевую роль — вокруг неё сформировалась экосистема (LoRA, ControlNet, ComfyUI) и новая структура отрасли.

В 2023 году во второй половине Runway, Pika, , , Vidu улучшили AI‑видео: повысили разрешение, увеличили длительность, улучшили стабильность движения. В 2024 году критерии конкуренции в сфере видеомоделей изменились — отрасль оценивает близость к реальному производственному процессу. OpenAI Sora стала знаковым событием для ускорения развития видеогенерации. Google Veo сохраняет планку качества за счёт высокого разрешения, встроенного аудио и генерации сложных сцен. ByteDance Seedance повышает практичность видеомоделей — в частности, в согласованности кадров, отображении движений и создании коммерческих материалов. Некоторые создатели уже используют Seedance вместо части реальных съёмок — в превью рекламных идей, концепт‑видео, демонстрации товаров, контенте для соцсетей.

Видеомодели имеют более высокие затраты на обучение, вывод и сложность по сравнению с текстовыми и визуальными моделями. Компании чаще используют закрытые продукты и API для возврата затрат. В открытом сегменте видеогенерации активны модели Али Вансян, Тэнсюн Хуньюань Видео, LTX, однако они уступают закрытому решению Seedance. H3 же сигнализирует о переходе конкуренции в сфере генерации видео от сравнения закрытых флагманских решений к конкуренции в области открытых экосистем и способности внедрения в промышленность.

// оригинал
Leiphone ↗ Читать оригинал
8 просмотров
// поделиться Telegram VK