论文
MC-CXR:视觉语言模型中上下文引起的干扰的多上下文胸部 X 射线基准
MC-CXR: A Multi-Context Chest X-ray Benchmark for Context-Induced Disruption in Vision-Language Models
摘要
视觉语言模型 (VLM) 越来越多地用于临床流程,其中胸部 X 光片与检索到的报告、初步记录或先前成像一起进行解释。现有的基准测试模型是否能够单独正确回答,而不是在合理的上下文与图像发生冲突时是否保留正确的仅图像决策。我们引入了多情境胸部 X 射线 (MC-CXR),这是一个将 240 个病例扩展为 2,522 个实例的基准,通过配对扰动隔离情境引起的干扰。每个案例都会修复当前图像和目标发现,同时通过文本和先前的 CXR 呈现匹配的可靠且具有误导性的上下文,并在可用的情况下提供视觉叠加。 MC-CXR 定义了三个任务系列和两个配对指标,即切换错误率和上下文对齐错误率。我们评估了十个 VLM,涵盖开源通用系统、医疗领域和闭源系统。仅图像精度是必要的,但还不够。误导性文本来源的平均转换率范围为 45.6-78.1%,误导性视觉来源的平均转换率范围为 35.7-61.7%。在转换后的预测中,74.6% 的预测与文本的误导性标签一致,而 17.6% 的预测与视觉上下文一致,差距为 57.0 分 (95% CI 50.9-62.8)。这种文本-视觉不对称是在标准化直接回答协议下观察到的。该数据集可在 PhysioNet 上获取。