论文

VIHD:基于视觉干预的幻觉检测用于医学视觉问答

VIHD: Visual Intervention-based Hallucination Detection for Medical Visual Question Answering

模型推理推理验证与自校正

摘要

虽然医学多模态 大语言模型 (MLLM) 在辅助诊断方面显示出了希望,但它们仍然经常产生幻觉反应,这些反应在语言上似乎合理,但缺乏视觉证据。这种幻觉给临床决策带来风险,需要有效的检测。现有的内省检测方法主要通过分析基于原始或扰动输入的模型响应来执行不确定性估计或逻辑验证。然而,这种外部扰动通常是启发式的且与上下文无关,它忽略了解码过程中生成的标记和相关视觉标记之间的内部跨模式依赖性。为了解决这个问题,我们提出了 VIHD,一种基于视觉干预的幻觉检测方法,它利用目标视觉标记掩蔽来校准语义熵,以实现更有效的幻觉检测。 VIHD 通过视觉依赖探测 (VDP) 定位视觉主导解码器层,通过标记掩码执行视觉干预解码 (VID) 以校准语义分布,并将生成的校准语义熵 (CSE) 量化为可靠的幻觉信号。使用两个医学 MLLM 对三个医学 VQA 基准进行的广泛实验表明,VIHD 始终优于最先进的方法,强调了细粒度视觉依赖性对于幻觉检测的重要性。代码可在 https://github.com/Jiayi-Chen-AU/VIHD 获取