论文

IMCBench:基于临床图像的多轮医学对话评测

IMCBench: A benchmark for multimodal LLMs in Image-grounded Medical Conversations

模型评测基准与评测资源

摘要

大语言模型与视觉语言模型的最新进展使多模态数据推理成为可能——为决策支持与分诊等临床应用提供机会。但既有医疗AI基准碎片化:一些支持多轮对话但缺图像——另一些提供多模态输入但聚焦单轮QA任务。为填补缺口——我们介绍IMCBench——以图像为依据的多轮医疗对话基准——把真实公开临床图像与合成患者档案配对以仿真真实患者-临床医生交互。每段对话沿三个临床维度评估:安全性、准确性与诊断中不确定性的恰当使用。我们跨四个模型家族(Claude、GPT、Nova与Llama)基准测试八个多模态前沿模型——以经专家临床医生标注校准的LLM陪审团评分按1-5分打分。结果显示Claude Opus 4.6取得最高总分(3.61)——其次Claude Sonnet 4.6(3.30)与GPT-5.2(3.29)——但无模型在所有维度占优——且安全在恶性与罕见病情上双双退化(Δ均为-0.27)。消融研究进一步揭示视觉输入与EHR上下文都对安全引导有贡献(各自移除时安全平均降0.18与0.23)——更强模型更有效利用视觉特征。合起来——这些发现表明准确临床描述不保证安全患者引导——促成医疗AI多维评估框架的需要。

IMCBench:多模态LLM在图像接地医疗对话中的基准:论文配图
图 1:IMCBench 概述。数据集构建:将公共皮肤科图像 (DDI) 与合成 EHR (Synthea) 相结合,形成临床连贯的 ⟨\langleimage、EHR⟩\rangle 对。场景生成:对临床任务和 ⟨\langleimage、EHR⟩\rangle 对以及患者个性进行采样,以生成真实的场景和初始查询。对话模拟:通过多轮对话模拟多模态患者与健康人工智能交互。在评估过程中,大语言模型评审团根据三个临床指标对对话进行评分。