论文

评估具有挑战性的真实临床案例的多轮多模式诊断推理

Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases

模型评测基准与评测资源

摘要

临床诊断评估不仅要评估模型是否能够提供正确的诊断,还要反映临床实践的现实,包括多模态信息的逐步披露、诊断假设的动态更新以及临床推理的不断完善。然而,现有的多模态 大语言模型 (MLLM) 评估通常依赖于单轮或孤立任务,因此很难完全捕捉现实世界临床诊断的复杂性。为了弥补这一差距,我们开发了 ClinMM-Bench,这是迄今为止最大的多轮多模式临床诊断评估基准。 ClinMM-Bench 包含 1,089 个具有挑战性的真实临床病例和 8 个专业的 3,760 张医学图像。我们使用两级评估框架系统地评估了 15 个具有代表性的 MLLM,该框架评估了诊断准确性和诊断推理质量。结果表明,专有模型实现了最高的总体诊断准确性,但所有模型中完全正确诊断的比例仍然有限。在诊断推理质量方面,当前模型可以识别合理的诊断方向,但在生成可靠的诊断推理方面仍然存在相当大的局限性。错误分析进一步确定了五种有代表性的故障模式:信息合成故障、知识图谱错误、感知错误、过早关闭和视幻觉。