论文
验证幻影:绘制医疗 VQA 中自我验证的可靠性边界
Verification Mirage: Mapping the Reliability Boundary of Self-Verification in Medical VQA
摘要
自我验证,即在新的环境中重新调用相同的视觉语言模型 (VLM) 来检查其自己生成的答案,越来越多地用作医学视觉问答 (VQA) 的默认安全层。我们认为这种做法从根本上来说是不可靠的。我们引入[方法名称],这是一种诊断框架,用于通过将验证者行为分解为辨别能力和一致性偏差来映射医学 VLM 自我验证的可靠性边界。由于验证者和答案生成器是容量耦合的,因此验证者可能会过度同意生成器,从而产生验证幻影:由于错误接受不正确的答案而导致验证者错误率高和一致性偏差高的机制。通过评估五个医学 VQA 数据集和七个医学任务中的六个开放权重 VLM,我们发现这个边界是强任务条件的。知识密集型临床任务最容易陷入幻觉,简单的任务更难以抵抗,感知任务则介于两者之间。验证也无法提供独立的安全信号:逻辑混合效应分析表明,当生成器出错时,验证者错误和一致性偏差的可能性更大,而显着性分析表明,验证者相对于生成器而言,对图像证据的关注不足,这种现象我们称为懒惰验证者。交叉验证可以减少但不能消除幻象。此外,当在多轮参与者-验证者循环中重用验证时,大多数最初错误的答案会被错误验证锁定。由于我们的实验使用干净的基准,观察到的可靠性边界可能低估了实际临床部署中的失败。