论文
视觉注意力漂移,但锚点保持不变:通过跨层视觉锚点减轻多模式 大语言模型 中的幻觉
Visual Attention Drifts,but Anchors Hold:Mitigating Hallucination in Multimodal Large Language Models via Cross-Layer Visual Anchors
摘要
多模态 大语言模型 经常遭受物体幻觉。虽然现有的研究利用了注意力增强和视觉回溯,但我们发现这些工作对于最终模型阶段的注意力漂移缺乏足够的解释性。在本文中,我们研究了视觉特征的逐层演化,并发现幻觉源于深层注意力从早期层回归到初始视觉噪声。我们观察到输出的可靠性取决于在中间层而不是最终层获取视觉锚点。基于这些见解,我们提出了 CLVA,它代表跨层视觉锚点,这是一种 无需训练 方法,可以增强关键的中间层特征,同时抑制回归噪声。这种方法利用从注意力动态中捕获的基本锚点,有效地将深层注意力拉回到正确的视觉区域。我们在不同的架构和基准测试中评估了我们的方法,在计算时间和 GPU 内存没有显着增加的情况下展示了出色的性能。