论文
MedRealMM:中文在线问诊的真实世界多模态基准
MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation
摘要
大语言模型(LLM)日益部署于在线医疗问诊,但既有基准与真实临床实践错位:许多依赖合成对话或患者模拟器、忽略患者上传的医学图像、或用选择题或词汇重叠指标评估开放式临床响应——都不能反映临床质量。我们提出MedRealMM,一个从全国性中国互联网医院的去标识化医患交互构建的大规模多模态在线问诊基准。MedRealMM用多模态临床挑战点(MCCP)抽取框架识别真实问诊轨迹中的临床高难时刻,把每处转为标准化下一响应生成任务并保留前序图文上下文;每实例配医生精修的案例专属量规——奖励临床可取行为、惩罚不安全、无依据或自相矛盾的响应。当前版本含跨64个临床科室的5,620个真实多模态案例。我们评估19个通用与医疗专用LLM(含纯文本与多模态系统):图像信息对可靠临床表现至关重要,当前前沿模型仍低于在线医生响应;尽管部分前沿模型满足的正向临床标准不亚于医生,它们触发更多负向标准——表明安全敏感的错误规避仍是核心瓶颈。MedRealMM为真实在线问诊中的多模态医疗推理评估提供现实、可复现的基准。数据集将在Hugging Face公开。
