DeepDigest
← все статьи
Vision

Vision

60 статьи по теме

cs.CV
arXiv
Cornell University Library
arXiv cs.CV

Новый подход к анализу футбольных матчей: система SoccerNet 2026 повышает точность отслеживания действий игроков

Система SoccerNet 2026 анализирует футбольные матчи, отслеживая действия игроков; за счёт новых алгоритмов показатель Macro-F1 вырос с 48,6 до 58,94.

читать →
~1 мин 434 просмотра
cs.CV
arXiv
Cornell University Library
arXiv cs.CV

Новый метод распознаёт действия по данным с датчиков — точность до 98,4%

Разработан неконтролируемый метод распознавания действий по данным IMU с использованием автоэнкодера и LSTM; точность на DaLiAc и PAMAP2 — 96,6% и 98,4%.

читать →
~1 мин 470 просмотра
cs.LG
arXiv
Cornell University Library
arXiv cs.LG

ИИ научился рисовать научные схемы: представлен новый тест для оценки изображений

Представлен тест SciDraw-Bench для оценки научных рисунков, сгенерированных ИИ. Он проверяет корректность надписей, изображений и соблюдение правил. Система SciDraw AI лучше общих моделей.

читать →
~1 мин 434 просмотра
cs.CV
arXiv
Cornell University Library
arXiv cs.CV

LaViD: как языковая модель учит компьютер «видеть»

LaViD — платформа для передачи знаний от LLM к моделям компьютерного зрения. Превосходит существующие методы, повышает точность распознавания объектов.

читать →
~1 мин 419 просмотра
cs.CV
arXiv
Cornell University Library
arXiv cs.CV

Aloe-Vision: новые модели для анализа медданных по изображениям

Созданы модели Aloe-Vision для анализа медданных по изображениям, набор данных Aloe-Vision-Data и тест CareQA-Vision. Модели открыты, протестированы и готовы к использованию.

читать →
~1 мин 488 просмотра
cs.CV
arXiv
Cornell University Library
arXiv cs.CV

ReWorld: новый подход к обучению моделей автономного вождения

ReWorld — платформа для оптимизации представлений в моделях автономного вождения; улучшила качество генерации видео и производительность моделей на датасетах nuScenes и NAVSIM.

читать →
~1 мин 481 просмотра
cs.CV
arXiv
Cornell University Library
arXiv cs.CV

Новый тест DMV-Bench: как проверить зрительную память ИИ-агентов

DMV-Bench — тест для оценки зрительной памяти ИИ-агентов на основе каталога товаров; архитектура DualMem превзошла другие мультимодальные системы.

читать →
~1 мин 444 просмотра
cs.CV
arXiv
Cornell University Library
arXiv cs.CV

ИИ помогает диагностировать аутизм по домашним видео: новый метод на базе Gemini 2.5 Pro

Модель Gemini 2.5 Pro адаптирована для диагностики РАС по видео: точность оценки врачей выросла на 40%, диагностика по F1 — на 53%.

читать →
~1 мин 436 просмотра
cs.LG
arXiv
Cornell University Library
arXiv cs.LG

PairSAE: новый инструмент для расшифровки работы моделей в структурной биологии

PairSAE — метод, помогающий понять работу моделей в структурной биологии: он выделяет понятные характеристики данных и позволяет избежать ошибок прежних подходов.

читать →
~1 мин 445 просмотра
Leiphone

NVIDIA NitroGen и новинки ICML 2026: достижения в ИИ

NVIDIA NitroGen номинирована на премию CVPR 2026. На конференциях CVPR и ICML 2026 представлены новые наборы данных, модели и исследования в области ИИ — от мультимодального кода до логических рассуждений LLM. Компания Runway выпустила модель видеогенерации Gen-4.5, а Mistral AI укрепляет позиции на рынке ИИ-услуг.

читать →
~2 мин 470 просмотра
cs.AI
arXiv
Cornell University Library
arXiv cs.AI

ИИ-планирование наблюдений за космосом: новая система проверки решений

Разработана система для проверки решений ИИ в планировании работы телескопов — она повышает надёжность наблюдений и сокращает потери времени.

читать →
~1 мин 488 просмотра
cs.AI
arXiv
Cornell University Library
arXiv cs.AI

NeuraDock Agent: новый инструмент для анализа когнитивной нагрузки в реальном времени

Учебное пособие по NeuraDock Agent — инструменту для обработки ЭЭГ и анализа когнитивной нагрузки в реальном времени с контролем качества данных и интеграцией LLM.

читать →
~1 мин 1640 просмотра
cs.CV
arXiv
Cornell University Library
arXiv cs.CV

DiCoBench: новый тест выявил слабые места мультимодальных моделей в анализе изображений

DiCoBench — тест для оценки способности MLLM анализировать несколько изображений высокого разрешения; выявил значительный разрыв в точности между моделями и человеком.

читать →
~1 мин 1663 просмотра
cs.CV
arXiv
Cornell University Library
arXiv cs.CV

Новый метод точно подбирает 3D-формы: от грубого эскиза к детализации

Разработан гибридный метод подбора нежёстких 3D‑форм по принципу «от грубого к точному» — он эффективен в сложных сценариях и превосходит существующие решения.

читать →
~1 мин 1653 просмотра
cs.LG
arXiv
Cornell University Library
arXiv cs.LG

ИИ раскрывает тайны полярного сияния: как модель «видит» атмосферу

Учёные выяснили, как ИИ-модели интерпретируют полярное сияние — модель улавливает сезонные циклы и структуру штормов без явных инструкций.

читать →
~1 мин 1305 просмотра
cs.CV
arXiv
Cornell University Library
arXiv cs.CV

PhyEditBench: новый тест для проверки «физического мышления» моделей редактирования фото

PhyEditBench — тест для оценки физического понимания моделей редактирования изображений. Включает 238 реальных и 35 синтетических примеров. Представлена программа PhyWorld, превосходящая аналоги.

читать →
~1 мин 1642 просмотра
cs.CV
arXiv
Cornell University Library
arXiv cs.CV

ForeAgent: агент, который учится распознавать поддельные ИИ‑изображения

ForeAgent — система для выявления поддельных ИИ‑изображений, которая постоянно учится и показывает высокую точность в тестах (до 93,3%)

читать →
~1 мин 1903 просмотра
cs.CV
arXiv
Cornell University Library
arXiv cs.CV

CRISP: новый способ проверить, насколько ИИ понимает пространство и образы

CRISP — метод оценки визуально‑пространственного интеллекта ИИ с помощью 3D‑графиков и протокола oracle, позволяющий отделить логическое мышление от проблем восприятия.

читать →
~1 мин 1151 просмотра
cs.CV
arXiv
Cornell University Library
arXiv cs.CV

Новый метод создаёт длинные видеоролики: забывание и адаптация в деле

Разработана сеть FFN для обработки многочасовых видеороликов: модель адаптируется, работая всего с тремя кадрами, и использует новую метрику для оптимизации обработки. Создан датасет EpicTours (до 3 часов).

читать →
~1 мин 1619 просмотра