论文

通过区域感知注意力再校准缓解视觉语言模型中的目标幻觉

Mitigating Object Hallucinations in Vision-Language Models through Region-Aware Attention Recalibration

模型推理解码与生成控制

摘要

生成事实上不正确的目标——通常称为目标幻觉——仍是大视觉语言模型(LVLM)中的一个顽固挑战。当前应对该问题的方法——从昂贵的数据驱动微调、高延迟的对比解码到生硬的注意力头截断——常常以牺牲计算效率或模型特征空间的连续性为代价。为克服这些局限,我们提出一种新颖的免训练推理策略,它作为区域感知的自适应加权机制运作,动态纠正语义漂移,而不依赖突兀的启发式截断。通过跨多个注意力头计算抗离群值的统计中点,我们为可靠的视觉表示建立了稳定锚点。随后,我们利用映射到各区域的头间分歧动态确定干预预算,通过连续的惩罚调制温和地抑制诱发幻觉的注意力路径。这一再校准过程有效纠正视觉-语义错位,同时完整保留生成流畅性与语言先验。在CHAIR、POPE和MME等标准多模态基准上的全面评估表明,我们的策略大幅削减实例级与句子级幻觉。结果显示相较当代基线达到最先进性能,证实了本方法的效率与算法稳健性。我们的代码将公开。

通过区域感知注意力再校准缓解视觉语言模型中的目标幻觉:论文配图
图 1. 我们提出的 SADI 的性能和流程。 (左)幻觉缓解效果比较。 (右)SADI 机制示意图。通过利用稳健的中值共识和空间方差引导的软掩蔽,SADI 在单次前向传递过程中实现了注意力权重的平滑、连续的重新校准,避免了先前推理时间干预的严重延迟和特征中断。说明空间感知动态干预 (SADI) 机制的管道图。左侧部分比较性能指标。右侧部分显示的流程图显示了多头自注意力、鲁棒中值一致性提取、空间方差计算以及应用于 pre-softmax logits 的自适应软掩蔽。