Новый метод борьбы с ошибками в мультимодальных ИИ-моделях
Система VIGIL улучшает связь между текстом и изображениями в мультимодальных ИИ-моделях, снижая число ошибок и галлюцинаций. Требует меньше данных, чем аналоги.
60 статьи по теме
Система VIGIL улучшает связь между текстом и изображениями в мультимодальных ИИ-моделях, снижая число ошибок и галлюцинаций. Требует меньше данных, чем аналоги.
APRTrack — система для надёжного отслеживания объектов в сложных условиях (при искажениях и неполных данных), проверена на нескольких датасетах.
Разработана мультимодальная модель для обнаружения метановых шлейфов на спутниковых снимках: она эффективнее аналогов и требует меньше ресурсов.
Система изучает 3D‑физику по видео: переводит анализ из 2D в 3D, моделирует поведение объектов с учётом физических законов, успешно прошла тесты.
DinoLink — платформа для сжатия данных в системах V2X: снижает объём передаваемой информации в 139 раз, сохраняет качество данных, ускоряет работу в узкополосных средах.
Аудит тестов на Deepfake показал, что они могут не отражать реальные угрозы — универсальные модели приближаются по эффективности к специализированным детекторам.
Создан набор данных TUB и метрика PCD для оценки потери информации в мутной подводной среде — это улучшит работу моделей компьютерного зрения.
GeMoE — метод адаптивной маршрутизации для моделей VisionLanguage на базе MoE: повышает эффективность использования ресурсов, сохраняя производительность и увеличивая частоту активации экспертов.
Разработан метод гибридного слияния данных для настройки моделей зрения, который эффективнее прежних подходов — протестирован на 34 наборах данных, показывает лучшее соотношение точности и задержки.
Новая нейросеть с высокой точностью прогнозирует параметры лазерной сварки, анализируя изображения сварочной ванны и параметры процесса. Точность прогнозирования состояния проплавления — 99,35%.
Разработан метод анализа когнитивных задач через МРТ: от переноса данных «один к одному» к анализу связей «многие к одному» с применением BIP и 1127 моделей.
Предложен метод оценки доли данных, использованных для обучения ИИ-модели, без сложных дополнительных моделей и скрытых данных. Протестирован на моделях генерации изображений.
Fast-LeWM ускоряет планирование действий в визуальных системах и снижает накопление ошибок по сравнению с LeWM.
Разработан метод обнаружения наводнений с помощью топологического анализа спутниковых снимков — он даёт более понятные и надёжные результаты по сравнению с прежними моделями.
Разработан метод MCTS для решения экстремальных задач комбинаторной геометрии: он учитывает геометрические ограничения и использует симметрии для ускорения поиска решений, что позволило получить новые результаты по ряду задач.
На выставке Google I/O 2026 продемонстрировали, как можно использовать ИИ для реализации творческих и технических проектов. С помощью различных моделей (Gemini, Nano Banana, Lyria 3 Pro и других) создали фильм, разработали визуальный стиль бренда, запустили музыкальное шоу и видеоигру, разработали приложение для заказа кофе и многое другое. Проекты объединили человеческое творчество и возможности искусственного интеллекта.
Разработан метод оценки биомассы деревьев в городах по данным лидара и оптических камер с воздуха — без ручного аннотирования, с высокой точностью.
Платформа LCG позволяет создавать согласованные серии изображений из текста, используя SRA и RCC. Для обучения создан набор данных LCCD (600 тыс. последовательностей).
Гибридный метод с обработкой изображений и ML оценивает свежесть фруктов с точностью свыше 90%, упрощая контроль качества в сельском хозяйстве.
Компания Unconventional под руководством Навина Рао разработала модель ИИ Un-0 для генерации изображений. Она построена на осцилляторной архитектуре, которая отличается от традиционных решений. Рао утверждает, что технология позволит снизить энергопотребление ИИ в 1000 раз.