论文

回答之前先看清楚:通过显着性驱动的感知调整减轻 LVLM 中的幻觉

Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment

模型推理解码与生成控制

摘要

大型视觉语言模型(LVLM)在多模态理解方面表现出了卓越的能力。然而,他们仍然容易产生幻觉,产生与视觉证据不一致的反应。现有的缓解方法主要解决语言先验偏差或跨模式不平衡,而感知和记忆中的渐进性视觉退化仍未得到充分探索。在这项工作中,我们提出了显着性驱动的感知重新调整(SDPR),这是一个 无需训练 框架,可以减轻整个推理过程中视觉意识的退化。具体来说,我们首先引入显着性驱动的注意力重新分配,以释放被非语义水槽标记劫持的注意力,从而恢复关键的视觉证据。其次,我们识别 KV 缓存中的空间失真,并提出显着性驱动的缓存对齐,以在生成过程中保留与查询相关的视觉特征。最后,我们引入先验约束对比解码来惩罚由主导语言先验引起的不忠实预测。我们提出的 SDPR 对幻觉具有很强的抵抗力,因为它在整个生成轨迹上对视觉意识进行了整体调整。跨不同 LVLM 架构的大量实验表明,SDPR 在幻觉和通用基准测试上都优于最先进的方法,不需要额外的训练,并且运行时开销最小。代码可在 \href{https://github.com/PengSyuChen/SDPR}{\color{blue}{here}} 获取。