Retrieval augmented generation (RAG) — важная концепция при разработке приложений на базе больших языковых моделей (LLM). Большинство существующих RAG-приложений ориентировано на текст, однако значительная часть информации передаётся через визуальный контент — например, в презентациях со слайдами. С появлением мультимодальных LLM (таких как GPT-4V) стало возможным применять RAG к визуальному контенту в слайдах.
Существуют два основных подхода к реализации multi-modal RAG для презентаций:
1. Мультимодальные эмбеддинги: слайды извлекаются в виде изображений, для каждого изображения создаются мультимодальные эмбеддинги, затем по запросу пользователя выбираются подходящие изображения и передаются в GPT-4V для синтеза ответа.
2. Мультивекторный ретривер: слайды извлекаются в виде изображений, GPT-4V создаёт краткое описание каждого изображения, описания с ссылками на исходные изображения встраиваются в эмбеддинги, по сходству описания и запроса пользователя выбираются подходящие изображения, которые затем передаются в GPT-4V для синтеза ответа.
У каждого подхода есть свои плюсы и минусы. Мультимодальные эмбеддинги проще в реализации, но могут испытывать трудности с распознаванием графиков и таблиц, которые визуально похожи. Мультивекторный ретривер использует зрелые модели для встраивания текста и может детально описать графики и диаграммы, но требует больше ресурсов и затрат на суммирование изображений.
Для оценки методов использовали презентацию Datadog, содержащую визуальный и качественный контент. Создали публичный бенчмарк из 10 вопросов. Результаты оценки:
* Top K RAG (только текст) — 20 %;
* мультимодальные эмбеддинги — 60 %;
* мультивекторный ретривер с суммированием изображений — 90 %.
Мультимодальные подходы значительно превосходят RAG только с текстом. GPT-4V хорошо справляется с извлечением структурированных данных из изображений — например, может правильно определить количество клиентов по слайду с разнообразным визуальным контентом. При этом главная сложность — корректный поиск нужного изображения. Суммирование изображений заметно улучшает поиск по сравнению с мультимодальными эмбеддингами, но требует дополнительных ресурсов для предварительного расчёта описаний.
Также выпущен шаблон для быстрого создания мультимодальных RAG-приложений для презентаций — он использует мультимодальные эмбеддинги Chroma и OpenCLIP. Чтобы начать работу, достаточно загрузить презентацию и выполнить две команды — для построения векторного хранилища и запуска тестовой среды.