DeepDigest
arXiv cs.CV · · ~1 мин

DiCoBench: новый тест выявил слабые места мультимодальных моделей в анализе изображений

DiCoBench — тест для оценки способности MLLM анализировать несколько изображений высокого разрешения; выявил значительный разрыв в точности между моделями и человеком.

cs.CV
arXiv
Cornell University Library

Гэн Ли и Юйсинь Пэн представили DiCoBench — тест для оценки того, насколько хорошо мультимодальные модели большого языка (MLLM) могут анализировать несколько изображений высокого разрешения (почти 2K). В отличие от прежних тестов, DiCoBench проверяет способность моделей улавливать неявные визуальные подсказки без текстовых подсказок. Тест включает 765 сэмплов, разделённых на две группы: с дифференциальными и общими визуальными подсказками. Он охватывает 8 задач восприятия и представлен в формате заданий с несколькими вариантами ответов. Оценка 18 MLLM показала, что даже самые продвинутые модели сильно отстают от человека по точности (у людей — 98,3%) в передаче микродеталей.

// оригинал
arXiv cs.CV ↗ Читать оригинал
1664 просмотров
// поделиться Telegram VK