论文

HaloProbe:视觉语言模型中物体幻觉的贝叶斯检测和缓解

HaloProbe: Bayesian Detection and Mitigation of Object Hallucinations in Vision-Language Models

模型推理推理验证与自校正

摘要

大型视觉语言模型可以在图像描述中产生物体幻觉,这突出表明需要有效的检测和缓解策略。先前的工作通常依赖于模型对视觉标记的注意力权重作为检测信号。我们发现,由于隐藏的混杂因素,特别是描述中的标记位置和对象重复,基于粗粒度注意力的分析是不可靠的。这导致了辛普森悖论:当统计数据汇总时,注意力趋势会逆转或消失。基于这一观察,我们引入了 HaloProbe,这是一个贝叶斯框架,可分解外部描述统计数据和内部解码信号来估计 词元级 幻觉概率。 HaloProbe 使用平衡训练来隔离内部证据,并将其与学习到的先验优于外部特征相结合,以恢复真实的后验。虽然基于干预的缓解方法通常会通过修改模型的内部结构来降低实用性或流畅性,但我们使用 HaloProbe 作为非侵入性缓解的外部评分信号。我们的实验表明,HaloProbe 引导的解码比最先进的基于干预的方法更有效地减少幻觉,同时保留实用性。