В 2026 году на ACM Web Conference (WWW 2026) была представлена работа «WWW 2026 ||GAIR Paper 110» автора Чжан Лу. Статья посвящена MEDRGAG-фреймворку — новой парадигме для медицинских вопросов и ответов (QA), которая решает проблему противоречия между неполным внешним поиском и ненадёжной памятью модели. Работа получила награду Best Paper Awards (лучшая длинная статья).
Авторы исследования — Ли Лэй (первый автор, выпускник Китайского университета Жэньминь), Чжоу Сяо (доцент Китайского университета Жэньминь) и У Сянь (директор лаборатории Tencent Tiangu).
Суть подхода MedRGAG заключается в принципе «требования к знаниям»: сначала определяется, каких знаний не хватает для ответа на вопрос, а не выбирается между поиском и генерацией. MedRGAG использует процесс «извлечение — дополнение — выбор» для организации знаний, объединяя внешний поиск и внутренние параметрические знания.
Существуют два основных подхода к дополнению знаний модели:
* RAG (Retrieval-Augmented Generation) — поиск информации извне. Обеспечивает обоснованность ответов, но может дать неполный ответ при пропуске ключевых данных в поиске.
* GAG (Generation-Augmented Generation) — использование знаний, «запомненных» моделью через параметры. Даёт релевантный ответ, но рискует включить ложную информацию.
MedRGAG отличается от RAG и GAG тем, что фокусируется не на слиянии данных или разрешении конфликтов, а на проверке полноты знаний, необходимых для ответа. Он координирует многоисточниковый поиск, восполнение пробелов и выбор доказательств вокруг запроса.
Работа MedRGAG состоит из нескольких этапов:
1. Сбалансированный поиск в многоисточниковых медицинских данных для получения всестороннего начального набора доказательств.
2. Использование модуля KGCC (Knowledge-Guided Context Completion) для определения недостающей информации. KGCC работает в три этапа:
* суммирование: сжатие каждой найденной документа в набор связанных с вопросом знаний, отметка нерелевантных документов как «нет полезной информации»;
* выявление пробелов: определение ключевых недостающих знаний, необходимых для полного ответа;
* дополнение: генерация документов для заполнения выявленных пробелов.
3. Использование модуля KADS (Knowledge-Aware Document Selection) для «сборки доказательств». KADS анализирует, какие блоки знаний нужны для ответа на вопрос, и оценивает, какой документ какой блок дополняет. Отбор идёт не по принципу «наиболее похожий на вопрос документ», а по принципу «какая комбинация документов лучше всего покрывает знания, необходимые для ответа».
KADS решает проблему обычных reranker’ов и сортировок по сходству, которые склонны отдавать приоритет внешне похожим текстам и могут упускать ключевые сведения, важные для медицинских рассуждений. Например, KADS, выбрав 5 документов, достигает точности, сопоставимой или превышающей Merge All (10 документов).
В исследовании участвовали 43 модели и 5 бенчмарков. MedRGAG не требует переобучения медицинских моделей; включает в качестве «читателей» Qwen2.5-7B, LLaMA-3.1-8B, Ministral-8B. MedRGAG протестирован на бенчмарках: MedQA-US, MedMCQA, MMLU-Med, PubMedQA, BioASQ-Y/N.
Результаты тестирования показали, что MedRGAG достигает оптимальных или близких к оптимальным показателей в большинстве комбинаций «датасет × читатель», в среднем занимает первое место. Относительные улучшения:
* на 12,5 % по сравнению с MedRAG;
* на 4,5 % по сравнению с MedGENIE;
* на 15,3 % по сравнению с ответом без внешних знаний.
Пример применения MedRGAG: анализ случая пациента с мутацией NF2 — система выбирает один документ из поиска и два генерируемых, чтобы дать правильный ответ («опухоль мозговых оболочек»).
При внедрении системы в медицинскую сферу (например, в больницу) необходимо учитывать задержки — MedRGAG включает дополнительные этапы (поиск пробелов в знаниях, генерация контекста), что повышает стоимость рассуждений. Однако эти этапы можно оптимизировать: параллелизовать, использовать кэширование, более эффективные сервисы рассуждений, преобразовать функциональные модули в специализированные малые модели. Также требуются клинические проверки, проверка соответствия требованиям и оценка безопасности.
MedRGAG предъявляет определённые требования к вспомогательным моделям — при переходе с GPT-4o-mini на лёгкие модели качество заметно ухудшается. Для развёртывания в средах с ограниченными ресурсами можно обучить или преобразовать специализированные малые модели, сфокусированные на разбиении медицинских проблем и выборе доказательств.
В ходе диалога с автором статьи Ли Лэем обсуждались вопросы, связанные с поведением сортировщиков при работе с данными, генерируемыми большими моделями. Выявлено, что обычные сортировщики склонны отдавать предпочтение документам, сгенерированным большой моделью, при одновременном попадании документов из хранилища и сгенерированных документов в пул кандидатов.
Метод, описанный в статье, получил награду Best Paper благодаря новому подходу к объединению внешних знаний и параметризованных знаний, предложению методов повышения надёжности медицинских ответов и потенциалу применения в более широких системах усиления знаний. Мотив авторов — отразить реальный процесс работы врача, который опирается и на собственный опыт, и на авторитетные источники информации.
Ссылки на материалы