论文

通过注意力不平衡​​纠正减轻 LVLM 中的物体幻觉

Mitigating Object Hallucinations in LVLMs via Attention Imbalance Rectification

模型推理解码与生成控制

摘要

大视觉语言模型(LVLM)中的物体幻觉严重损害了它们在现实应用中的可靠性,对其在自动驾驶和医学图像分析等高风险场景中的部署构成了关键障碍。通过系统的实证研究,我们发现,跨模态(即视觉和语言)和模态内部(单个标记之间)的注意力分配不平衡,与物体幻觉的发生表现出很强的因果关系。利用这种洞察力,我们引入了一个称为注意力不平衡​​的新概念,它不仅量化了注意力差异的程度,而且还直观地描绘了导致对象幻觉的潜在模式(例如,对不相关的语言标记的过度关注或对辨别性视觉特征的关注不足)。为了减轻物体幻觉,我们进一步提出了注意力不平衡​​纠正(AIR),这是一种轻量级的解码时间干预方法,可以重新分配注意力权重并调整注意力分布,以纠正模态和标记方面的不平衡。对四个主流 LVLM 和具有七个基线的三个基准(CHAIR、POPE 和 MM-Vet)的广泛评估表明,AIR 持续降低了物体幻觉率,与基线相比降低了 35.1%,同时将 LVLM 在不同视觉语言任务中的一般能力提高了 15.9%。