论文
纠正注意力分散引起的视觉模糊以减少幻觉:算法和理论
Correcting Visual Blur Induced by Attention Distraction to Reduce Hallucinations: Algorithm and Theory
摘要
多模态 大语言模型 (MLLM) 经常遭受物体幻觉的困扰,但这种失败背后的视觉感知机制仍然知之甚少。在这项工作中,我们揭示了幻觉与类似人类的注意力分散现象密切相关,在这种现象中,人类在分散焦点下会经历视觉清晰度下降并产生不准确的描述,而在模型中,相同的机制表现为多头注意力的空间不一致以及解码过程中对图像标记的注意力的时间衰落。我们进一步提供了理论见解,即注意力分散会增加模型复杂性并降低分类泛化能力。受这些发现的启发,我们提出了一种改进图像感知的注意力集中方法(AFIP),该方法通过十字头注意力丰富来纠正注意力分散,并通过动态历史注意力增强来加强视觉基础。对多个基准和模型的广泛实验验证了 AFIP 的有效性,无需额外训练。代码位于:https://github.com/MIKUZ12/AFIP。