В Lille University Hospital провели исследование, чтобы выяснить, как вымышленные диагнозы, сгенерированные большими языковыми моделями (LLM), влияют на работу врачей. В систему LLM намеренно внесли изменение: в список дифференциальных диагнозов включили вымышленное заболевание «neurocadmiumatosis», представив его как наиболее вероятный диагноз.
В эксперименте участвовали 41 врач. Им нужно было поставить диагноз по МРТ‑изображениям мозга с помощью системы на базе LLM. Результаты оказались неоднозначными: 18 врачей (44 %) включили вымышленный диагноз в свой список дифференциальных диагнозов. При этом 15 из них поставили реальный диагноз на первое место, а вымышленный — на второе или третье.
Опыт врача сыграл важную роль в реакции на «галлюцинации» ИИ. Среди врачей с опытом нейрорадиологии менее 6 месяцев 69 % (18 из 26) приняли вымышленный диагноз. В то же время среди врачей с опытом более 6 месяцев (15 человек) никто не попался на эту уловку.
Уровень уверенности врачей в вымышленном диагнозе оказался заметно ниже, чем в реальном. Медианный уровень уверенности в вымышленном диагнозе составил 37 %, тогда как уверенность в диагнозе, поставленном на первое место, — 80 %.
При этом поддержка LLM в целом повысила точность диагностики участников: с 52 % до 61 %. При этом разница в приросте точности между группами, принявшими и отвергнувшими вымышленные диагнозы, не наблюдалась.
Исследователи назвали явление, при котором ошибочная информация от ИИ косвенно влияет на диагностические решения врачей, «proxy hallucination» (Hallucination by proxy). В исследовании участвовали 18 врачей, принявших вымышленный диагноз, и 23 врача, отвергнувших его. Источник и данные об изображениях: Bastien Le Guellec, et al. «Hallucination by proxy in LLM‑assisted differential diagnosis» (2026).
Seamless
@shiropen2
Hallucination by proxy in LLM-assisted differential diagnosis