DeepDigest
LangChain Blog · · ~2 мин

Multi-modal RAG на презентациях: подходы и оценка

Разработаны два подхода к реализации multi-modal RAG для презентаций со слайдами. Оценка показала, что мультимодальные подходы (60 % и 90 %) существенно превосходят RAG с использованием только текста (20 %). Выявлены плюсы и минусы каждого метода, а также выпущен шаблон для быстрого развёртывания приложений.

Multi-modal RAG на презентациях: подходы и оценка

Retrieval augmented generation (RAG) — важная концепция при разработке приложений на базе больших языковых моделей (LLM). Большинство существующих RAG-приложений ориентировано на текст, однако значительная часть информации передаётся через визуальный контент — например, в презентациях со слайдами. С появлением мультимодальных LLM (таких как GPT-4V) стало возможным применять RAG к визуальному контенту в слайдах.

Существуют два основных подхода к реализации multi-modal RAG для презентаций:
1. Мультимодальные эмбеддинги: слайды извлекаются в виде изображений, для каждого изображения создаются мультимодальные эмбеддинги, затем по запросу пользователя выбираются подходящие изображения и передаются в GPT-4V для синтеза ответа.
2. Мультивекторный ретривер: слайды извлекаются в виде изображений, GPT-4V создаёт краткое описание каждого изображения, описания с ссылками на исходные изображения встраиваются в эмбеддинги, по сходству описания и запроса пользователя выбираются подходящие изображения, которые затем передаются в GPT-4V для синтеза ответа.

У каждого подхода есть свои плюсы и минусы. Мультимодальные эмбеддинги проще в реализации, но могут испытывать трудности с распознаванием графиков и таблиц, которые визуально похожи. Мультивекторный ретривер использует зрелые модели для встраивания текста и может детально описать графики и диаграммы, но требует больше ресурсов и затрат на суммирование изображений.

Для оценки методов использовали презентацию Datadog, содержащую визуальный и качественный контент. Создали публичный бенчмарк из 10 вопросов. Результаты оценки:
* Top K RAG (только текст) — 20 %;
* мультимодальные эмбеддинги — 60 %;
* мультивекторный ретривер с суммированием изображений — 90 %.

Мультимодальные подходы значительно превосходят RAG только с текстом. GPT-4V хорошо справляется с извлечением структурированных данных из изображений — например, может правильно определить количество клиентов по слайду с разнообразным визуальным контентом. При этом главная сложность — корректный поиск нужного изображения. Суммирование изображений заметно улучшает поиск по сравнению с мультимодальными эмбеддингами, но требует дополнительных ресурсов для предварительного расчёта описаний.

Также выпущен шаблон для быстрого создания мультимодальных RAG-приложений для презентаций — он использует мультимодальные эмбеддинги Chroma и OpenCLIP. Чтобы начать работу, достаточно загрузить презентацию и выполнить две команды — для построения векторного хранилища и запуска тестовой среды.

// оригинал
LangChain Blog ↗ Читать оригинал
8 просмотров
// поделиться Telegram VK