DeepDigest
← все статьи
Multimodal

Multimodal

77 статьи по теме

Leiphone

Step AOS и другие инновации: борьба за будущее AI-терминалов

В сфере AI‑терминалов идёт борьба между компаниями, которые добавляют функции и которые переопределяют правила взаимодействия. Компания «» представила бренд STEPX, систему Step AOS, агента Amoo и смартфон на базе модели STEPX Neo. OpenAI планирует выпустить свой AI‑смартфон в первой половине 2027 года. Apple и Google также активно работают над новыми решениями для интеграции AI в экосистемы.

читать →
~5 мин 262 просмотра
Leiphone

Периферийный ИИ: инфраструктура и решения от Анъи на WAIC 2026

На конференции WAIC 2026 обсуждается будущее периферийного ИИ. Компания Анъи планирует создать инфраструктуру для вычислений периферийного ИИ и инициировала создание AIOS‑альянса. Ключевая задача — найти баланс между различными параметрами устройств и обеспечить массовое внедрение ИИ.

читать →
~4 мин 249 просмотра
Leiphone

Модель «2.0» от Сайсы Цзисянь: новый подход к научным исследованиям с ИИ

Модель «2.0» от «Сайсы Цзисянь» представляет новый подход к научным исследованиям с использованием ИИ — объединение общих знаний и специализированных научных способностей. Модель уже показала лучшие результаты по сравнению с рядом существующих ИИ-моделей в разных научных задачах и применяется в механике, материаловедении и других областях. Создана единая платформа ScienceOne.ai для поддержки исследовательских процессов.

читать →
~3 мин 272 просмотра
Leiphone

NEO-unify от Шантан: мультимодальный подход к ИИ-дизайну

Компания Шантан развивает мультимодальные технологии, делая ставку на интеграцию языка и зрения. Модель SenseNova U1 Pro — первый в мире мультимодальный инструмент с принципом «понимание, генерация, действие» — достигает уровня сдачи работ в 70 %. Конечная цель компании — создание AGI, способного работать в физическом мире.

читать →
~6 мин 284 просмотра
TechNews / AI

PNG-изображения как инструмент атаки на AI-помощники для кода

Исследователи показали, что PNG-изображения могут использоваться для атак на AI-помощники для работы с кодом. Вредоносные инструкции, скрытые в изображениях, активируются позже и могут привести к утечке конфиденциальных данных. Уровень риска зависит от особенностей реализации AI-помощника, а не только от LLM.

читать →
~2 мин 318 просмотра
QbitAI

Unisonmind: демонстрация Physical AGI в Цинхуа

В Цинхуа университете показали возможности системы Unisonmind на примере робота-собаки «Сяо Тянь». Система демонстрирует Physical AGI: способна ориентироваться в пространстве, координировать действия людей и решать неожиданные задачи. Один и тот же когнитивный фундамент может работать на разных физических платформах.

читать →
~2 мин 334 просмотра
L Leiphone
Leiphone

Alipay и WeChat: шаг к коммерциализации ИИ-агентов в Китае

Alipay и WeChat делают шаги к коммерциализации ИИ‑агентов в Китае. За последние три месяца обе платформы запустили ряд продуктов и сервисов с использованием искусственного интеллекта. Эксперты считают, что текущий год может стать первым годом коммерциализации агентов.

читать →
~3 мин 422 просмотра
Leiphone

RoboBrain Orca: ИИ прогнозирует следующее состояние мира

RoboBrain Orca — мультимодальная модель, которая формирует представление о состоянии мира и моделирует его эволюцию. Она обрабатывает разные типы данных (текст, изображения, видео) и учится на неосознанном и сознательном опыте. Модель использует 125 000 часов видео и 160 млн аннотаций к событиям и может стать основой для сложных когнитивных систем.

читать →
~2 мин 368 просмотра
cs.CL
arXiv
Cornell University Library
arXiv cs.CL

Система предскажет фейковые новости и вспышки насилия: мультимодальный подход

Мультимодальная система на базе XLM-RoBERTa и CLIP с точностью 98 % выявляет фейковые новости и признаки насилия, учитывая текст, изображения и геоданные.

читать →
~1 мин 373 просмотра
Leiphone

Agentic от Volcano Engine: новая система оптимизации качества видео

Система Agentic от Volcano Engine оптимизирует качество видео с помощью агентной системы, заменяя человеческий конвейер постобработки. Она учитывает разные типы видео и их требования, используя модели оценки восприятия и набор инструментов для обработки. Ключевой оператор GenVR нацелен на охват различных типов контента и снижение затрат на моделирование сцен.

читать →
~4 мин 380 просмотра

VLM-модели: как работают GPT-4o, Gemini, Claude Vision и Qwen-VL

Современные модели Vision Language (VLM) объединяют понимание визуального контента и языка. Модели GPT-4o, Gemini, Claude Vision и Qwen-VL применяются в разных сферах — от образования до автоматизации. Они способны анализировать изображения, документы, диаграммы, вести мультимодальные диалоги, но имеют ограничения — например, могут пропускать детали или давать неверные ответы.

читать →
~2 мин 245 просмотра
QbitAI

Физический ИИ, как сказал Вонг Ин Хун, был введен в лабораторию наук о жизни этим китайским трансграничным игроком

Китайская компания Da Chi-Son запустила в Шанхае лабораторию искусственного интеллекта и представила системы ProtoPilot и BioLab Bench для проведения экспериментов в области наук о жизни. В статье также рассматривается проблема интеграции ИИ в лабораторные процессы и роль крупных игроков из Кремниевой долины в этой сфере.

читать →
~18 мин 452 просмотра
Leiphone

Vidu S1, который подталкивает поколение видео к новой эре взаимодействия в реальном времени

Компания Biotech запустила модель Vidu S1 для интерактивных видеосценариев в реальном времени. Модель позволяет генерировать видео нового поколения с возможностью непрерывного взаимодействия, включая голосовое управление и видеозвонки.

читать →
~10 мин 413 просмотра
QbitAI

Карта записи Dingding A1 отмечена в отчёте Gartner о носимых ИИ-устройствах

Gartner включила карту записи Dingding A1 в отчёт о носимых устройствах с ИИ. Устройство помогает сотрудникам эффективно записывать информацию и получать аналитические данные в реальном времени. Ключевое отличие Dingding A1 — тесная интеграция с корпоративным суперприложением Dingding.

читать →
~2 мин 472 просмотра
Leiphone

AI MediaKit от Volcano Engine: автоматизация создания видеоконтента

AI MediaKit от Volcano Engine автоматизирует создание и обработку аудио- и видеоконтента с помощью агентов. Набор инструментов объединяет множество функций (более 100) для редактирования, улучшения качества, транскодирования и других задач. Концепция «подключи и играй» упрощает разработку приложений и позволяет агентам эффективно выполнять рабочие процессы — от понимания контента до его доставки на платформы.

читать →
~4 мин 427 просмотра
ITmedia AI+

Sakana Fugu: Sakana AI использует Google Cloud для мультиагентной системы

Sakana AI создала мультиагентную систему Sakana Fugu на базе платформы Gemini Enterprise Agent Platform от Google Cloud. Система включает три слоя и объединяет несколько моделей ИИ. По заявлению разработчиков, версия Fugu Ultra в некоторых задачах превосходит американские модели Claude Mythos Preview и Claude Fable 5.

читать →
~2 мин 426 просмотра
Leiphone

Nvidia и Sharpa: почему выбрали руку Sharpa Wave на ICRA 2026

На ICRA 2026 обсудили выбор Nvidia в пользу руки Sharpa Wave для робота Isaac GR00T. Sharpa продемонстрировала высокую производительность: 22 степени свободы, тысячи тактильных датчиков и возможности работы с данными, приближенные к человеческим. Сотрудничество компаний выходит за рамки одного робота — они разрабатывают общие платформы для сбора данных и управления роботами.

читать →
~4 мин 433 просмотра
Leiphone

Мобильные сети в эпоху физического ИИ: вызовы и решения от Huawei

Появление физического ИИ ставит перед мобильными сетями новые задачи — от расширения диапазона подключений до повышения требований к качеству связи. Huawei предлагает внедрять искусственный интеллект в структуру сети, чтобы динамически распределять ресурсы, обеспечивать автономную эксплуатацию и поддерживать сложные сценарии использования. Это приведёт к трансформации бизнес‑моделей операторов — от продажи трафика к продаже гарантии качества обслуживания.

читать →
~4 мин 434 просмотра
Google AI Blog

Обновления Google в сфере ИИ: Gemini, Android 17 и другие новинки

В июне 2026 года Google представила ряд ИИ-обновлений — от новых моделей (Gemma 4 12B, Nano Banana 2 Lite, Gemini Omni Flash) до функций в Android 17 и сервисах вроде Google Finance и Gemini 3.5 Live Translate. Среди новшеств — динамик Google Home с поддержкой Gemini, обновлённый NotebookLM и учебные тетради в приложении Gemini. Также компания рассказала о проектах в сфере образования, науки и безопасности.

читать →
~3 мин 747 просмотра