论文
MedObvious:通过临床分类揭露 VLM 中的医学 Moravec 悖论
MedObvious: Exposing the Medical Moravec's Paradox in VLMs via Clinical Triage
摘要
视觉语言模型 (VLM) 越来越多地用于医疗报告生成和视觉问答等任务。然而,流畅的诊断文本并不能保证安全的视觉理解。在临床实践中,解释从诊断前的健全性检查开始:验证输入的读取是否有效(正确的形态和解剖结构、合理的观点和方向,以及没有明显的完整性违规)。现有的基准在很大程度上假设这一步已经解决,因此错过了一个关键的失败模式:即使输入不一致或无效,模型也可以产生合理的叙述。我们引入了 MedObvious,这是一个包含 1,880 个任务的基准测试,它将输入验证隔离为小型多面板图像集的集级一致性功能:模型必须识别是否有任何面板违反了预期的一致性。 MedObvious 跨越五个渐进层,从基本方向/模态不匹配到临床动机的解剖/观点验证和分类式提示,并包括五种评估格式来测试跨界面的稳健性。通过评估 17 个不同的 VLM,我们发现健全性检查仍然不可靠:一些模型在正常(阴性对照)输入上出现异常,当缩放到更大的图像集时性能会下降,并且测量的准确性在多项选择和开放式设置之间存在很大差异。这些结果表明,医疗 VLM 的预诊断验证仍未解决,在部署前应将其视为一种独特的、安全关键的功能。