论文
MedReaMM:评估专家级临床诊断综合的大型多模态模型
MedReaMM: Evaluating Large Multimodal Models on Expert-Level Clinical Diagnostic Synthesis
摘要
大语言模型 (LLM) 在诊断决策中的应用引起了越来越多的兴趣。然而,现有的基准主要侧重于文本推理或孤立的视觉问答(VQA)任务,缺乏临床叙述和医学成像的整体整合,因此无法评估专家临床判断的核心多模态诊断综合能力。为了弥补这一差距,我们引入了 MedReaMM,这是一个专门设计的基准,旨在评估模型在完整信息范式下合成异质临床证据(包括详细的患者病史和多个医学图像)以进行准确鉴别诊断的能力。 MedReaMM 根据来自顶级医学期刊的病例报告和精选的临床病例数据库构建,包含 625 个经过专家验证的病例,每个病例平均有 2.79 张医学图像,总共有 1,042 个用 ICD-11 代码注释的标准化诊断。这些案例主要代表罕见、非典型或多系统的表现,需要超出常规模式识别的专家级证据整合。我们评估了 23 个大型多模态模型 (LMM),发现大多数模型的诊断准确度得分低于 50%,这凸显了多模态诊断综合能力的巨大差距。进一步分析发现,医学知识熟练程度、医学图像理解和证据整合都与诊断表现高度相关。