DeepDigest
Leiphone · · ~5 мин

MedErrBench: оценка моделей в обнаружении медицинских ошибок

Команда из филиала Нью-Йоркского университета в Абу-Даби и клиники Кливленда разработала MedErrBench — систему для обнаружения, локализации и исправления медицинских ошибок. Система тестирует различные языковые модели на десяти типах ошибок на английском, китайском и арабском языках. В эксперименте модели Doubao и DeepSeek в целом превзошли GPT-4o и Gemini.

MedErrBench: оценка моделей в обнаружении медицинских ошибок

Команда из филиала Нью-Йоркского университета в Абу-Даби и клиники Кливленда в Абу-Даби разработала многоязычный эталон оценки MedErrBench. Система предназначена для обнаружения, локализации и исправления медицинских ошибок. MedErrBench тестирует различные языковые модели — GPT-4o, Gemini, Llama, Qwen, DeepSeek, ALLAM, MedGemma, HuatuoGPT и другие — на десяти типах типичных медицинских ошибок. Исследование опубликовано в ACL 2026 Findings (https://aclanthology.org/2026.findings-acl.573.pdf), код доступен на GitHub (https://github.com/congboma/MedErrBench). Первый автор статьи — Congbo Ma, постдокторский исследователь из Clinical AI Lab.

MedErrBench охватывает английский, китайский и арабский языки. Источники данных для системы:
* английский и китайский — из MedQA (экзаменационные вопросы для врачей США и Китая), с учётом сложных случаев и полного клинического контекста;
* арабский — из MedArabiQ и MedAraBench, данные сформированы с помощью отбора по ключевым словам и ручной проверки.

Выделено 10 типов медицинских ошибок:
1. Diagnosis (ошибка в диагнозе);
2. Management (ошибка в схеме лечения);
3. Treatment (ошибка в лечении);
4. Pharmacotherapy (ошибка, связанная с лекарствами);
5. Causal Organism / Pathogen (ошибка в определении патогена);
6. Lab/Serum Value Interpretation (ошибка в интерпретации лабораторных анализов);
7. Physiology (ошибка в физиологических знаниях);
8. Histology (ошибка в гистологии);
9. Anatomy (ошибка в анатомии);
10. Epidemiology (ошибка в эпидемиологии).

В MedErrBench применены три вида вспомогательных аннотаций:
* Important Medical Words — аннотирование ключевых медицинских сущностей;
* Difficulty Level — оценка сложности случая (простой, средний, сложный);
* Reasoning Type — аннотирование типа рассуждений, необходимых для решения задачи.

Качество данных обеспечивалось клинической экспертизой в два этапа. На первом этапе три NLP‑исследователя (носители английского, китайского и арабского языков) выполняли первичную разметку: выявляли галлюцинации и неестественные формулировки, удаляли ошибки и избыточную информацию от больших языковых моделей, разбивали длинные предложения. В китайских данных дополнительно обрабатывали расстановку запятых. На втором этапе по два независимых врача для каждого языка проверяли все образцы на медицинскую достоверность: исправляли ошибки преобразования данных, верифицировали метки типов ошибок, проверяли ключевые клинические термины, уровни сложности и типы рассуждений. Расхождения в экспертизе классифицировали как логические, классификационные или орфографические ошибки — орфографические исправляли сразу, остальные корректировали при наличии возражений у любого врача. Для согласования разметки с врачами применяли итеративный подход: врачи размечали 20–30 примеров, команда проверяла и возвращала обратную связь, процесс повторяли несколько раз.

Модели выполняли три задачи:
* Detection — определение наличия ошибок в тексте;
* Localization — указание местоположения ошибок;
* Correction — генерация исправленного текста.

Для оценки коррекции использовали метрики: ROUGE-1, ROUGE-2, ROUGE-L, BLEU, BERTScore и BLEURT. ROUGE и BLEU измеряют соответствие сгенерированного текста и эталонного ответа на уровне слов и фраз, BERTScore и BLEURT — с точки зрения семантического представления и сигналов оценки, усвоенных от человека.

В эксперименте на англоязычном наборе данных Doubao-1.5-Thinking-Pro показал наилучшие результаты: точность обнаружения — 0,779, точность определения местоположения — 0,774. Следом идут DeepSeek-R1 и gpt-4o-mini. Медицинские модели MedGemma и HuatuoGPT не превзошли общие модели и даже отстали от некоторых из них. Причины этого:
* цели обучения медицинских моделей не полностью соответствуют задаче обнаружения и исправления медицинских ошибок (они ориентированы на медицинские вопросы, клинические тексты и медицинские изображения);
* общие модели обучаются на более масштабных и разнообразных наборах данных, что усиливает их универсальные способности (понимание языка, рассуждение, выполнение инструкций).

Модели серий Doubao и DeepSeek в целом превзошли GPT-4o и Gemini на трёхъязычном наборе данных. Причины:
* DeepSeek включает китайско-английские материалы, что даёт преимущество в многоязычных медицинских задачах;
* модели DeepSeek (например, DeepSeek-R1) имеют механизм рассуждения, который важен для сложных задач обнаружения и исправления ошибок.

Эксперимент проведён в 2025 году, тестировались GPT-4o и GPT-4o mini; результаты могут измениться при использовании моделей GPT 2026 года.

Выяснилось, что модели лучше работают с китайским исходным набором данных, чем с его переводами на английский и арабский языки — показатели снижаются, особенно в задачах определения местоположения и исправления ошибок. При этом модели, обученные преимущественно на английском (например, GPT, Gemini), показывают в китайском исходном наборе данных лучшие результаты обнаружения, чем в английском исходном наборе. Исходные клинические данные ценнее переведённых многоязычных из‑за потери контекста и возможных искажений при переводе (результаты в приложении J.1 статьи).

На результаты влияют:
* стратегия подсказок (Prompt): включение определения типа ошибки и нескольких примеров помогает модели точнее понимать и исправлять медицинские ошибки;
* сложность примеров: Doubao-1.5-thinking-pro лучше работает со средними примерами, DeepSeek-V3 — с простыми, Gemini 2.0 Flash — со сложными; Doubao-1.5-thinking-pro демонстрирует наивысшую уверенность в предсказаниях при любой сложности;
* тип клинических данных (знаниевые vs ситуационные): большинство моделей лучше работают с ситуационными данными, Llama3-8B лучше справляется с знаниевыми задачами, у Qwen2.5-7B-Instruct наибольший разрыв в производительности между типами задач.

Среди ограничений системы:
* нет разметки серьёзности ошибок (мелкие и критические ошибки не различаются);
* дефицит высококачественных открытых медицинских данных на арабском языке (команда работает над расширением набора данных).

Роль AI в медицине — вспомогательная: выявлять потенциальные ошибки и информацию, которую мог упустить врач, снижать риск медицинских ошибок; финальное решение остаётся за врачом. MedErrBench — первый шаг команды; цель — стимулировать исследования в области обнаружения и исправления медицинских ошибок. В дальнейших исследованиях планируется изучение применения системы в реальных медицинских процессах (диагностика, составление историй болезни и др.).

Команда проводит исследования в двух направлениях:
1. Использование Agentic AI для повышения эффективности обнаружения, локализации и исправления ошибок: применяется архитектура интеллектуальных агентов для повышения точности и качества генерации моделей.
2. Разработка новых оценочных показателей для задач исправления ошибок в медицине: текущие показатели (ROUGE, BLEU Score, BLEURT) оценивают все слова как равнозначные, что не подходит для медицинских задач. Например, если модель неправильно указала заболевание, исправление считается неудачным, но ROUGE может дать высокий балл. Новая система показателей будет придавать больший вес ключевым медицинским терминам и включать оценку безопасности — проверку, действительно ли исправленный текст устраняет клинические риски.

Анонсируется IJCAI 2026, создана группа для участников конференции — там будут доступны информация о дедлайнах и регламенте подачи материалов, общение с коллегами, данные о последних исследованиях и помощь в период проведения мероприятия. Для вступления в группу нужно отсканировать QR‑код или добавить в контакты WhatsApp Qvv0909777, указав в заметке: IJCAI + учреждение/вуз + фамилия + направление.

// оригинал
Leiphone ↗ Читать оригинал
10 просмотров
// поделиться Telegram VK