论文
通过区域感知注意力再校准缓解视觉语言模型中的目标幻觉
Mitigating Object Hallucinations in Vision-Language Models through Region-Aware Attention Recalibration
摘要
生成事实上不正确的目标——通常称为目标幻觉——仍是大视觉语言模型(LVLM)中的一个顽固挑战。当前应对该问题的方法——从昂贵的数据驱动微调、高延迟的对比解码到生硬的注意力头截断——常常以牺牲计算效率或模型特征空间的连续性为代价。为克服这些局限,我们提出一种新颖的免训练推理策略,它作为区域感知的自适应加权机制运作,动态纠正语义漂移,而不依赖突兀的启发式截断。通过跨多个注意力头计算抗离群值的统计中点,我们为可靠的视觉表示建立了稳定锚点。随后,我们利用映射到各区域的头间分歧动态确定干预预算,通过连续的惩罚调制温和地抑制诱发幻觉的注意力路径。这一再校准过程有效纠正视觉-语义错位,同时完整保留生成流畅性与语言先验。在CHAIR、POPE和MME等标准多模态基准上的全面评估表明,我们的策略大幅削减实例级与句子级幻觉。结果显示相较当代基线达到最先进性能,证实了本方法的效率与算法稳健性。我们的代码将公开。
