论文

医学视觉语言模型真的依赖图像吗?反事实评估与困难负样本对比训练

Do Medical Vision Language Models Actually See? A Counterfactual Grounding Framework and Hard-Negative Contrastive Training for Visually-Reliant Medical VLMs

模型评测评测方法与指标

摘要

视觉语言模型在医学问答中报告较高准确率,但尚不清楚它们依赖视觉证据还是文本捷径。论文提出反事实评估:用空白图、像素打乱图、无图以及CLIP检索的困难负样本图替换输入,区分视觉和文本贡献,并定义视觉依赖分数VRS与视觉幻觉率VHR。CORAL在70亿参数的Qwen2.5-VL-7B上进行LoRA微调,以对比视觉证据目标CGO惩罚困难负样本换图后答案仍不变的现象。在PathVQA、PMC-VQA、SLAKE和VQA-RAD共400题的配对对照评估中,相比匹配的基础模型,CORAL的宏平均准确率提升6.7个百分点,P(Delta>0)=0.988;VHR下降8.0个百分点,P<0.001。两个MedVLThinker强化学习变体在这两项指标均未取得显著收益。换图在医学基准上造成的分数下降不超过6.5个百分点,在通用任务上则为48–61个百分点,显示CGO针对的视觉证据依赖差距。论文披露训练与评估基准重叠、次要指标统计检验功效不足等限制,并发布评估框架、训练代码与权重。