DeepDigest
Leiphone · · ~5 мин

vivago R1: турецкий ремейк «Звёздных войн» от мультимодального агента

Компания «» (HiDream.ai) представила многомодальный агент vivago R1, способный создавать видео неограниченной длины. В ходе тестов, включая создание турецкого ремейка «Звёздных войн», система продемонстрировала способность сохранять согласованность кадров, персонажей и стиля. Vivago R1 объединяет собственные и сторонние модели, выполняя работу по монтажу и нарративу, и сокращает путь от идеи до готового продукта.

vivago R1: турецкий ремейк «Звёздных войн» от мультимодального агента

18 июля 2026 года на конференции WAIC компания «» (HiDream.ai) представила многомодальный интеллектуальный агент vivago R1. Это первый в мире агент, способный создавать и редактировать видео неограниченной длины. Материнская компания vivago основана в Пекине в марте 2023 года, её основатель и CEO — Мэй Тао, ранее работавшая в Microsoft Asia Research Institute и JD. В 2025 году Мэй Тао была избрана членом ACM Fellow.

«» позиционируется как единственный в мире поставщик базовых моделей, поддерживающих текст, изображение, видео и 3D. Ранее был открыт исходный код модели HiDream-I1. В мае 2026 года компания выпустила на Product Hunt продукт Vivago Video Agent — он помогал с созданием персонажей, написанием сюжетов, составлением раскадровок и предварительным просмотром ключевых кадров. Продукт занял первое место в рейтинге за день, однако тогда длительность вывода была ограничена 3 минутами.

Ключевые особенности vivago R1 можно описать формулой «длинный, длинный, стабильный»:
* неограниченная длина видео, адаптация под разные сценарии (от короткометражек до рекламных роликов);
* способность к рассуждению в рамках длительных задач: формирование логики, расстановка кадров, настройка стиля, решение проблем с резкими сменами кадров и нарушением целостности сюжета;
* высокая стабильность генерации: благодаря AgentOS уровень успешности создания контента достигает около 85 %.

Vivago R1 — гибридная система, которая сочетает собственные модели компании, агрегацию сторонних видеомоделей и верхний уровень Agent для компоновки. Процесс генерации видео происходит на стороне сервера, а интерфейс взаимодействует только с шлюзом Vivago. Агент включает 17 функциональных навыков (видео, изображения, электронная коммерция, социальные медиа и др.), наиболее зрелый из них — навык cinematic-story-director.

Платформа Vivago объединяет несколько моделей: Sora 2, KeLing v2.6 Pro, Veo 3, Veo 3.1 и собственный Vivago 2.0. У компании также есть собственные модели — серия HiDream-O1-image и видеомодели Vivago 2.0/2.1 (последняя переименована в HiDream 2.0).

В интерфейсе vivago пользователь выбирает «способность» (например, text-to-video, reference-to-video, cinematic-story-director), а не конкретную модель — маршрутизация моделей полностью на стороне сервера. Параметр duration имеет значения от 4 до 15 секунд (по умолчанию — 5 секунд). Длинные видео создаются путём соединения нескольких сегментов. По умолчанию generate_audio равен true (включает аудиодорожку).

Проблема создания видео бесконечной длительности заключается не в непрерывном генерировании (это решается сегментированием), а в сохранении согласованности: недопущении скачков кадров, сохранении персонажей, непрерывности сюжета и единства стиля. Для этого используются единые эталонные изображения, которые генерируются на этапе Node5 и применяются для всех кадров на этапе Node8. Перед началом генерации создаётся трёхвидовая фотография персонажа, которая служит основой для всех кадров.

Процесс генерации видео через skill «cinematic-story-director» идёт по потоку Node0→Node9:
* N0 — понимание задачи;
* N1 — первый черновик истории;
* N2 — аудиовизуальный сценарий;
* N3 — разделение на сцены;
* N4 — художественное руководство;
* N5 — генерация «заблокированных» эталонных изображений персонажей/сцен/предметов (например, A01 «Али-капитан», A02 «Внеземной двор», A03 «Повелитель машин»);
* N6 — текстовое разделение по кадрам;
* N7 — подсказки для видео;
* N8 — генерация видео по сценам;
* N9 — монтаж.

Был проведён тест: создание фильма в стиле Йешылчама (турецкие низкобюджетные фильмы 60–80-х годов) — с множеством сцен и действий. Задача проверяла согласованность персонажей, предметов, стиля и повествования, а также возможность генерации длинных видео. Результат: видео длительностью 1 минута 11 секунд — повествование, смена кадров и переходов плавные, персонажи и предметы сохраняют единый образ, эстетика низкого бюджета сохранена. Есть незначительные недочёты: на 41-й секунде на 3–4 секунды ухудшается качество изображения, нарушается стиль; на отметке в 1 минуту меняется фон (с крыши на павильон), но это почти незаметно.

Другие тесты также показали хорошие результаты:
* В случае с «» проверялась способность сохранять консистентность образа питомца в видео. Тело собаки не искажалось, но были небольшие недочёты в сегменте с хаски и несоответствие стиля.
* Для проверки способности понимать задачи был создан вымышленный продукт — интеллектуальный проекционный модуль для кухни. Vivago показал несколько худший результат по сравнению с другими кейсами: были сложности с пониманием работы несуществующего продукта, в видео есть несоответствия пространственных позиций.
* В кейсе с «» проверялась возможность Vivago сгенерировать сразу 12 видео (по числу знаков зодиака) без ручного соединения фрагментов. Vivago сгенерировал изображения для всех 12 знаков и даже добавил один дополнительный.
* Кейс с «» также показал хорошие результаты: качественные сцены и звуковые эффекты, полученные из простых промтов.

Современные AI-видео в основном ограничены от нескольких секунд до двух минут: Google Veo 3.1 — около 8 секунд (отдельные отрезки), в сборе — 1–2 минуты; OpenAI Sora 2 — около 60 секунд (на потребительском рынке закрыт в апреле 2026 года); Kuaishou KeLing 3.0 — до двух минут. Vivago R1 потенциально может создавать непрерывные видео длиной более пяти минут. Sora 2 и vivago R1 решают проблему создания связного повествования с персонажами и единым стилем из коротких кадров.

В отрасли преобладает подход, основанный на компоновке существующих передовых моделей и соединении кадров между собой, а не на обучении единой модели для генерации длительного видео (одна видеомодель обычно генерирует около 8–12 секунд видео). В 2026 году появились работы по генерации длинных видео, например, фреймворк с ScripterAgent для написания сценариев, DirectorAgent для компоновки нескольких передовых видеомоделей и CriticAgent для проверки.

Наблюдается тенденция: возможности моделей генерации видео становятся базовой инфраструктурой, как электричество. К 2026 году разница в качестве изображения у Sora, , Veo, , сокращается, большинство из них открыли API. Модели становятся стандартным товаром. Конкуренция смещается с превосходства отдельной модели к способности объединить несколько моделей в работающую систему. Vivago R1 — пример такого агента для творчества: он сокращает путь от идеи до готового продукта, выполняя сложную работу по монтажу и нарративу.

Кроме того, «» завершила раунд финансирования C, за последние три месяца привлекла более 20 млрд юаней, в том числе 15 млрд юаней в рамках последнего раунда.

В статье от 23 июня 2026 года на сайте бизнес-школы Хааса в Беркли (автор — Akash Rathi, менеджер по продукту Google Pixel) высказана мысль, что модель и фреймворк для компоновки становятся товаром, а программный агент (включая уровень компоновки) — слабое «оборонительное сооружение» (moat) в бизнесе.

Также в 2026 году SpaceX приобрела Cursor за 600 млрд долларов, Manus чуть не был куплен за 2 млрд долларов, OpenRouter ведёт переговоры о продаже с крупными технологическими компаниями.

// оригинал
Leiphone ↗ Читать оригинал
5 просмотров
// поделиться Telegram VK