论文

MHSA:通过 LVLM 中的引导注意力减轻幻觉的轻量级框架

MHSA: A Lightweight Framework for Mitigating Hallucinations via Steered Attention in LVLMs

模型架构Transformer

摘要

大型视觉语言模型(LVLM)在不同的多模态任务中取得了卓越的性能,但它们仍然存在幻觉,生成与视觉输入不一致的内容。之前的工作 DHCP(通过跨模态注意模式检测幻觉)从跨模态注意的角度探索了幻觉检测,但没有解决幻觉缓解问题。在本文中,我们提出了 MHSA(通过引导注意力减轻幻觉),这是一种轻量级框架,通过学习纠正 LVLM 中的跨模式注意力模式来减轻幻觉。 MHSA 训练一个简单的三层 MLP 生成器,以在来自 DHCP 鉴别器和 LVLM 本身的监督信号的指导下产生正确的注意力。在推理过程中,MHSA 通过简单地将原始跨模态注意力替换为校正后的跨模态注意力,而不修改任何 LVLM 参数,从而减轻了跨各种数据集和 LVLM 的判别性幻觉和生成性幻觉。通过将跨模式注意力机制从幻觉检测扩展到幻觉缓解,MHSA 为 LVLM 中的幻觉研究提供了新颖的视角,并有助于提高其可靠性。