DeepDigest
← все статьи
Multimodal

Multimodal

77 статьи по теме

cs.CL
arXiv
Cornell University Library
arXiv cs.CL

Новый тест Indi-RomCoM выявил слабые места LLM в работе со смешанным индийско‑английским языком

Создан тест Indi-RomCoM для оценки LLM на смешанных индийско‑английских инструкциях; модели плохо с ними справляются, особенно при сильном смешивании языков.

читать →
~1 мин 456 просмотра
TechOrange

Ask Macy's: как Macy's с помощью ИИ повышает эффективность покупок

Macy's совместно с Google Cloud запустил сервис «Ask Macy's» — цифровой торговый помощник на базе ИИ. Система помогает покупателям быстрее находить подходящие товары, используя мультимодальный подход и виртуальную примерку. По данным бета‑тестирования, пользователи сервиса получают в 4,75 раза больше дохода за одно посещение.

читать →
~2 мин 290 просмотра
note.com / #AI

Veo 3 × Sora 2: из статичного изображения — в реалистичное видео

Модели ИИ Google Veo 3 и OpenAI Sora 2 позволяют создавать реалистичные видео из одного статичного изображения. Комбинированный рабочий процесс с использованием инструментов вроде CapCut и Nano Banana упрощает создание контента и помогает добиваться миллионов просмотров. Технология постепенно вытесняет традиционную фотосъёмку в маркетинге и рекламе.

читать →
~1 мин 307 просмотра
Zenn / AI

Nebula System: синхронизация эмоций NPC с Unity через LangGraph и SSE

Тиора разработал систему Nebula, которая синхронизирует мыслительный процесс ИИ с анимацией в Unity в реальном времени — благодаря этому NPC из простых текстовых ботов превращаются в эмоциональных партнёров игрока. В ходе разработки система прошла несколько этапов эволюции: от перехода на Unity и замены LangChain на LangGraph до интеграции MCP и RAG. Для решения проблемы задержек внедрена потоковая передача данных через SSE и собственный протокол передачи сигналов.

читать →
~3 мин 325 просмотра
cs.CL
arXiv
Cornell University Library
arXiv cs.CL

Модели языка жестов научились улавливать фонологические нюансы

Учёные оценили, как модели распознавания языка жестов улавливают фонологические особенности: выявлены различия между моделями на основе позы и пикселей, обнаружена частичная корреляция с восприятием человека.

читать →
~1 мин 468 просмотра
Google DeepMind

Nano Banana 2 Lite и Gemini Omni Flash: новые инструменты от Google

Google выпустил модели Nano Banana 2 Lite для генерации изображений и Gemini Omni Flash для создания и редактирования видео. Первая отличается высокой скоростью и экономичностью, вторая позволяет комбинировать разные типы данных для работы с видео. Разработчики могут объединять модели в единый рабочий процесс.

читать →
~2 мин 763 просмотра
AI Supremacy

Neo Labs: возможности ИИ в математике и естественных науках

Статья посвящена роли ИИ в науке, в частности в математике и естественных науках. Обсуждаются новые стартапы в сфере ИИ — Neo Labs — и их вклад в развитие технологий. Также рассматривается нерешённая математическая задача, поставленная Паулем Эрдешем, и роль ИИ в её возможном решении.

читать →
~2 мин 303 просмотра
cs.AI
arXiv
Cornell University Library
arXiv cs.AI

IMCBench: новый тест для ИИ в медицинских диалогах с использованием изображений

IMCBench — тест для оценки ИИ-моделей в медицинских диалогах с изображениями; тестировались Claude, GPT, Nova, Llama; лучший результат у Claude Opus 4.6 (3,61 балла).

читать →
~1 мин 432 просмотра
cs.LG
arXiv
Cornell University Library
arXiv cs.LG

Новый фильтр Калмана: агенты смогут точнее оценивать данные в сложных условиях

Создан новый фильтр Калмана (CA-NKCF) для распределённой оценки данных: он эффективнее аналогов и не требует точных данных о шуме, хорошо работает в сложных условиях.

читать →
~1 мин 390 просмотра
Leiphone

AXera Edge-Day: Aixin Yuanzhi представила решения для edge AI

В Шэньчжэне прошёл салон разработчиков AXera Edge-Day, организованный Aixin Yuanzhi. На мероприятии обсудили создание базы вычислительных мощностей для физического ИИ и коммерциализацию edge AI. Партнёры компании продемонстрировали реальные кейсы применения edge computing в разных сферах — от голосового взаимодействия до умной розничной торговли.

читать →
~3 мин 483 просмотра
cs.LG
arXiv
Cornell University Library
arXiv cs.LG

ИИ научился рисовать научные схемы: представлен новый тест для оценки изображений

Представлен тест SciDraw-Bench для оценки научных рисунков, сгенерированных ИИ. Он проверяет корректность надписей, изображений и соблюдение правил. Система SciDraw AI лучше общих моделей.

читать →
~1 мин 434 просмотра
L Leiphone
Leiphone

FLAG от Шанхайского института и университетов: восстановление структуры транскриптома

Институт Шанчжи, Шанхайский университет науки и технологии и Фуданьский университет представили фреймворк FLAG для восстановления структуры пространственного транскриптома. Модель переопределяет задачу с детерминированной регрессии на моделирование структурированного распределения и успешно справляется с «проклятием генетической размерности». Эксперименты показали преимущество FLAG по структурным показателям в сравнении с другими методами.

читать →
~2 мин 483 просмотра
Leiphone

Kuaishou на ICML 2026: представлены исследования по ИИ

Техническая команда Kuaishou представит ряд исследований на ICML 2026. Работы охватывают ключевые направления ИИ, включая большие языковые модели, обучение с подкреплением и компьютерное зрение. Конференция пройдёт с 6 по 11 июля в Сеуле.

читать →
~3 мин 462 просмотра
cs.CV
arXiv
Cornell University Library
arXiv cs.CV

Новый тест DMV-Bench: как проверить зрительную память ИИ-агентов

DMV-Bench — тест для оценки зрительной памяти ИИ-агентов на основе каталога товаров; архитектура DualMem превзошла другие мультимодальные системы.

читать →
~1 мин 444 просмотра
cs.AI
arXiv
Cornell University Library
arXiv cs.AI

MER-R1: новая система распознаёт эмоции с помощью «медленного» и «быстрого» мышления

MER-R1 объединяет «быстрое» и «медленное» мышление для точного распознавания эмоций; показала лучшую производительность на MER-UniBench и MME-Emotion.

читать →
~1 мин 427 просмотра
Leiphone

Agentic vCloud: эволюция видео-облака в эпоху агентов

Видео-облако трансформируется из инфраструктуры контента в инфраструктуру агентов. Аудио и видео становятся инструментом взаимодействия между людьми и ИИ. Volcano Engine развивает Agentic vCloud, внедряя мультимодальную связь и AI MediaKit для выполнения задач агентами в реальном времени. По данным IDC, сегмент взаимодействия аудио- и видеоматериалов с помощью ИИ в первой половине 2025 года достиг порядка 440 млн долларов.

читать →
~3 мин 480 просмотра
cs.CL
arXiv
Cornell University Library
arXiv cs.CL

GPT-4.1 Mini раскрывает финансовые связи: многоязычный подход к анализу причинно-следственных связей

Команда HSA_CORAL в рамках FinCausal 2026 сравнила разные модели для извлечения причинно-следственных связей из финансовых текстов на двух языках. Лучшая система — GPT-4.1 Mini — показала высокие результаты.

читать →
~1 мин 458 просмотра
cs.LG
arXiv
Cornell University Library
arXiv cs.LG

OverFlowLight: система для борьбы с пробками в реальном времени

Платформа OverFlowLight в реальном времени обнаруживает заторы и корректирует работу светофоров, снижая количество инцидентов с переполнением на 60,4% и увеличивая пропускную способность сети на 18,2%.

читать →
~1 мин 467 просмотра
cs.AI
arXiv
Cornell University Library
arXiv cs.AI

AI-ModelNet: сеть ИИ-моделей — новый шаг к их взаимодействию

Предложена концепция AI‑ModelNet — сети ИИ‑моделей для их взаимодействия и совместного решения задач, что может упростить практическое применение ИИ.

читать →
~1 мин 489 просмотра
Leiphone

NVIDIA NitroGen и новинки ICML 2026: достижения в ИИ

NVIDIA NitroGen номинирована на премию CVPR 2026. На конференциях CVPR и ICML 2026 представлены новые наборы данных, модели и исследования в области ИИ — от мультимодального кода до логических рассуждений LLM. Компания Runway выпустила модель видеогенерации Gen-4.5, а Mistral AI укрепляет позиции на рынке ИИ-услуг.

читать →
~2 мин 470 просмотра