论文

当光看还不够时:视觉注意力结构揭示了 MLLM 中的幻觉

When Looking Is Not Enough: Visual Attention Structure Reveals Hallucination in MLLMs

模型推理解码与生成控制

摘要

多模态 大语言模型 (MLLM) 已成为视觉推理和基础问答的关键接口,但它们仍然容易产生视觉幻觉,生成的响应与图像内容相矛盾或提及不存在的物体。一个核心挑战是,幻觉并不总是由简单的缺乏视觉注意力引起:模型仍然可能将大量注意力分配给图像标记,同时在内部转向错误答案。在本文中,我们表明,通过分层拉普拉斯能量测量的视觉注意力的高频结构揭示了出现幻觉偏好的层和 真值 答案短暂恢复的层。基于这一发现,我们提出了 LaSCD(拉普拉斯谱对比解码),这是一种 无需训练 解码策略,它通过拉普拉斯能量选择信息层并以封闭形式重新映射下一个标记 logits。对幻觉和一般多模态基准的实验表明,LaSCD 在保留一般功能的同时始终减少幻觉,突出了其作为忠实解码范例的潜力。该代码可从 https://github.com/macovaseas/LaSCD 获取。