论文
找到正确的视觉证据而不忘记:通过层间视觉注意力差异减轻 LVLM 中的幻觉
Finding the Correct Visual Evidence Without Forgetting: Mitigating Hallucination in LVLMs via Inter-Layer Visual Attention Discrepancy
摘要
大型视觉语言模型(LVLM)在广泛的视觉语言任务中表现出了卓越的性能。尽管取得了这些进展,但它们仍然容易产生幻觉,产生与视觉内容不一致的反应。在这项工作中,我们发现LVLM在对正确的视觉证据关注不够时容易产生幻觉,并在生成过程中逐渐忘记它。我们凭经验发现,虽然 LVLM 总体上对视觉证据的关注不够,但它们对特定层中的正确视觉证据表现出敏感性,并且具有显着的层间差异。受这一观察的启发,我们提出了一种新颖的幻觉缓解方法,该方法基于层间视觉注意力差异(ILVAD)增强视觉证据。具体来说,我们获得从早期生成的标记到跨层视觉标记的注意力权重,并将重复激活的标记识别为视觉证据,形成显着性图。然后,我们通过显着性图在生成过程中增强对视觉证据的关注,以减少视觉遗忘。此外,我们利用显着性图来获取生成文本对视觉证据的注意力分数,以便选择和强调强烈基于视觉证据的文本标记。我们的方法是无需训练,即插即用。对最近发布的五个模型进行的多项基准评估表明,我们的方法可以一致地减轻各种架构上不同 LVLM 中的幻觉。代码可在 https://github.com/ytx-ML/ILVAD 获取。