论文
PROVE:用于医学视觉问答中幻觉检测的证明引导的机制感知操作员验证
PROVE: Proof-guided Regime-aware Operator Verification for Hallucination Detection in Medical Visual Question Answering
摘要
在医学视觉问答(VQA)中,视觉语言模型(VLM)的幻觉可能会导致自信但不正确的反应,从而增加诊断错误的风险。现有的幻觉检测方法统一从响应一致性或视觉证据来估计 VLM 输出的可靠性。然而,这种跨问题的统一验证忽略了问题特定的特征,导致漏掉过度自信的错误和过度验证的误报。我们提出了 PROVE(证明引导的机制感知操作员验证),这是一种黑盒检测器,可根据每个问题的证据结构调整验证策略。 PROVE 根据问题所需的视觉证明类型将问题分为三种验证机制,激活五个互补运算符的特定机制子集,并通过以确定性问题答案特征为条件的轻量级校准层调整每个问题的运算符重要性。 PROVE 使用特定于问题的证据来重新衡量操作员的权重并生成校准的风险评分。在三个医学 VQA 基准和四个前沿 VLM 的 8048 个测试样本上进行评估后,PROVE 达到了 0.821 AUROC,比最强基线高出 +0.159,所有模型和基准都有一致的增益。