论文

MedQA-MM:医学视觉推理背后的捷径

MedQA-MM: Shortcuts Behind Medical Visual Reasoning

模型评测模型行为与机制分析

摘要

基准分数归功于最终答案,但不包括回答问题的途径。在医学多模态多项选择题 (MCQ) 中,这种区别很重要,因为正确的答案可以通过预期的图像查找或答案措辞中保留基准的线索、非视觉临床文本、可见图像文本、人工注释或设备/上下文伪影来支持。我们将由此产生的分数水平过度解释推理膨胀。这里,路线是可以支持答案选择的可观察输入路径,而不是关于模型隐藏认知的声明。在六个医学多模态 MCQ 数据集中,我们通过即时和图像侧审核、模态消融以及保留医学目标和答案关键的匹配修复,将候选线索与行为证据分开。在 13 配置开放模型面板中,全输入准确率为 62.63%,而纯文本和纯选项设置分别达到 53.96% 和 29.71%。删除长度间隙、绝对/显眼和空间/介词线索会使准确度降低 6.58、3.50 和 4.77 个百分点。我们还构建了 MedQA-MM,一个包含 1,000 项捷径缓解的子集,其中纯文本和纯选项的准确率分别下降至 5.21% 和 12.33%。这并不意味着模型从不使用图像;而是意味着模型从不使用图像。它表明医学图像推理主张需要路线级证据。