Гэн Ли и Юйсинь Пэн представили DiCoBench — тест для оценки того, насколько хорошо мультимодальные модели большого языка (MLLM) могут анализировать несколько изображений высокого разрешения (почти 2K). В отличие от прежних тестов, DiCoBench проверяет способность моделей улавливать неявные визуальные подсказки без текстовых подсказок. Тест включает 765 сэмплов, разделённых на две группы: с дифференциальными и общими визуальными подсказками. Он охватывает 8 задач восприятия и представлен в формате заданий с несколькими вариантами ответов. Оценка 18 MLLM показала, что даже самые продвинутые модели сильно отстают от человека по точности (у людей — 98,3%) в передаче микродеталей.
arXiv cs.CV
·
·
~1 мин
DiCoBench: новый тест выявил слабые места мультимодальных моделей в анализе изображений
DiCoBench — тест для оценки способности MLLM анализировать несколько изображений высокого разрешения; выявил значительный разрыв в точности между моделями и человеком.
// оригинал
arXiv cs.CV
↗ Читать оригинал
1664 просмотров
// похожие статьи