MedErrBench: оценка моделей в обнаружении медицинских ошибок
Команда из филиала Нью-Йоркского университета в Абу-Даби и клиники Кливленда разработала MedErrBench — систему для обнаружения, локализации и исправления медицинских ошибок. Система тестирует различные языковые модели на десяти типах ошибок на английском, китайском и арабском языках. В эксперименте модели Doubao и DeepSeek в целом превзошли GPT-4o и Gemini.