论文

EviAnchor:通过区域视觉证据补偿缓解大型视觉语言模型幻觉

EviAnchor: Mitigating Hallucinations in Large Vision-Language Models via Regional Visual Evidence Compensation

模型推理解码与生成控制

摘要

大型视觉语言模型 (LVLM) 经常生成不受视觉输入支持的内容。初步实验表明,视觉证据主要被纳入早期到中期解码器层的答案侧表示中,而其直接影响在后面的层中逐渐减弱。这种衰减表明,早期获得的视觉证据可能在下一代中没有得到充分利用。基于这一观察,我们提出了 EviAnchor,这是一种免训练的单分支推理框架,可以在整个生成过程中保留和重新激活视觉证据。 EviAnchor 引入了区域证据锚点 (REA) 插槽,以逐步将密集的视觉标记聚合成空间结构化表示。然后,它通过决策条件证据路由来加强当前决策状态对这些视觉锚点的访问,从而减轻对文本上下文的过度依赖。最后,模型恢复其原生 Transformer 计算,将检索到的视觉证据与问题语义和生成历史集成。 POPE、CHAIR 和 MMHal-Bench 的实验证明了视觉基础的持续改善。

EviAnchor:通过区域视觉证据补偿缓解大型视觉语言模型幻觉:论文配图
图 2:视觉证据跨层利用不足的定性说明。本机模型生成以红色突出显示的不受支持的对象。消除后面层中的原始视觉标记状态使这些幻觉提及几乎保持不变,这表明预测对后期层视觉表示的依赖性有限。