论文

休息时的注意力保持在休息时:打破视觉惰性,缓解认知幻觉

Attention at Rest Stays at Rest: Breaking Visual Inertia for Cognitive Hallucination Mitigation

模型推理解码与生成控制

摘要

就像静止的身体一样,我们发现多模态 大语言模型 (MLLM) 中的视觉注意力表现出明显的惯性,一旦在早期解码步骤中稳定下来,就基本上保持静态,并且无法支持认知推理所需的组合理解。虽然现有的幻觉缓解方法主要针对有关对象存在或属性的知觉幻觉,但它们仍然不足以解决需要对象间关系推导的认知幻觉。通过标记分析,我们将视觉惯性确定为一个影响因素:对语义关键区域的注意力仍然持续集中,并且无法动态支持关系推理。因此,我们提出了惯性感知视觉兴奋(IVE),它通过将认知推理建模为视觉注意的动态响应来打破这种惯性模式。具体来说,IVE 选择相对于历史关注趋势动态出现的视觉标记,同时区分表现出惯性行为的标记。为了进一步促进组合推理,IVE 引入了惯性感知惩罚,以防止过度集中并限制局部区域内注意力的持续性。大量实验证明了 IVE 在各种 MLLM 和基准测试中的有效性,无需额外训练。