论文
通过跨模式注意力漂移和基于掩模的验证检测大视觉语言模型中的物体幻觉
Detecting Object Hallucinations in Large Vision-Language Models via Cross-Modal Attention Drifts and Mask-Based Verification
摘要
尽管大型视觉语言模型(LVLM)最近取得了进展,但物体幻觉仍然是其可靠部署的主要障碍。现有的检测方法通常使用各个层的注意力来表征视觉基础,而其跨层的演变尚未得到充分探索。我们提出了 CADMP,一种轻量级的物体幻觉检测框架,它将相邻层跨模式注意力漂移与目标视觉掩蔽的预测敏感性相结合。在解码过程中,CADMP 量化连续跨模式注意力图之间的分布变化,以捕获视觉基础中的突然转变。然后,它选择漂移最大的过渡,定位相应的视觉相关区域,并测量屏蔽这些区域后预测概率的变化。这两个信号提供了互补的证据:注意力漂移表征了内部视觉基础的稳定性,而概率变化则验证了预测是否真正依赖于已识别的视觉证据。轻型探测器集成这两个信号来识别幻觉预测。在多个基准测试和代表性开源 LVLM 上进行的实验表明,CADMP 实现了始终如一的有竞争力的检测性能。消融研究进一步证实了相邻层漂移建模和基于掩模的视觉证据对齐验证的互补贡献。