论文
CXR-ContraBench:医疗 VLM 中否定选项吸引力的基准测试
CXR-ContraBench: Benchmarking Negated-Option Attraction in Medical VLMs
摘要
当胸部 X 光检查显示实变,但问题询问存在哪种发现时,医学视觉语言模型可能会回答“无实变”。这不仅仅是一个错误的选择:它是一种极性反转,发出与图像相矛盾的临床陈述。我们将这种失败研究为否定选项吸引力,其中模型被吸引到否定答案选项,即使它与视觉证据和问题都冲突。我们推出 CXR-ContraBench(胸部 X 射线矛盾基准),这是一种涵盖内部 ReXVQA 切片以及外部 OpenI 和 CheXpert 协议的诊断基准。该基准以现有发现问题为中心,其中尽管存在可见 X,但选择“无 X”会产生主要临床风险,并使用缺席发现问题作为模型是否复制否定措辞的二次测试。在 CheXpert 协议中,失败是严重且持续的。在严格的直接存在探针上,MedGemma 和 Qwen2.5-VL 分别仅达到 31.49% 和 30.21% 的准确度;在匹配的 135,754 条记录 CheXpert 训练分割协议中,两个模型对超过 62% 的存在问题都选择了否定选项。思想链提示减少了一些在场方的逆转,但并不能消除它们,并且可能放大不在场方的矛盾。最后,QCCV-Neg(否定的问题条件一致性验证器)无需重新训练即可确定性地修复测量的极性混淆子集,将 MedGemma 和 Qwen2.5-VL 在直接存在探针上的准确率提高到 96.60% 和 95.32%。这些结果表明,标准精度可以隐藏具有临床意义的推理时间极性失败。源代码和基准构建脚本可在 https://github.com/fangzr/cxr-contrabench-code 获取。