论文

没有基础的注意力:医学 VLM 中视觉解释的因果评估

Attention Without Grounding: Causal Evaluation of Visual Explanations in Medical VLMs

模型评测模型行为与机制分析

摘要

注意力和显着性热图被广泛用于解释胸部 X 射线的医学视觉语言模型 (VLM) 输出,但它们是否真正突出驱动预测的图像证据尚未经过因果测试。我们通过与 PadChest 上的放射科医生边界框重叠 (n=637)、CheXlocalize 上的放射科医生掩模内的归因质量 (n=643) 以及记录哪些区域在隐藏时改变答案的 16x16 补丁遮挡图来审核 忠实性。我们研究了三种 MedGemma-4B 变体、LLaVA-RAD 和 Qwen3-VL-8B-Instruct 上的跨家族探针以及专业的 CheXagent-2-3b,并使用两个经过 CXR 训练的分类器(DenseNet121、ResNet50)作为阳性对照。仅当模型使用图像并且注意力集中在遮挡改变预测的区域时,热图才是忠实的。没有经过评估的 VLM 符合这两个标准。 MedGemma 和 Qwen3-VL 使用该图像,但注意力与斑块遮挡重要性反相关(rho < 0,95% bootstrap CI 低于零)。 LLaVA-RAD 的注意力呈正相关,但该模型几乎是纯文本的(纯文本一致性为 99.1%,因果质量接近于零),因此相关性将两个接近于零的信号联系起来。人们的注意力也忽略了带注释的解剖结构:与真实区域的重叠永远不会击败移动或随机控制,并且没有任何方法将超过 22% 的质量放置在放射科医生面罩内。两个 CXR 分类器通过了所有指标,表明故障特定于 VLM 热图,而不是评估。这些热图在视觉上令人放心,但并不忠实;临床解释需要受控的定位指标和因果扰动,而不仅仅是目视检查。