论文

SAGE:利用注意力汇聚词元在解码中抑制视觉幻觉

SAGE: Sink-Aware Grounded Decoding for Multimodal Hallucination Mitigation

模型推理解码与生成控制

摘要

大型视觉语言模型 (VLM) 经常出现幻觉,生成与视觉输入不一致的内容。现有的方法通常通过事后过滤、额外的训练目标或外部验证来解决这个问题,但当幻觉出现时,它们不会在解码过程中进行干预。在这项工作中,我们介绍了 SAGE,一种 Sink-Aware Grounded Decoding 框架,它通过在生成过程中动态调节 self-attention 来减轻幻觉。幻觉与注意力接收标记密切相关——标点符号或功能标记尽管携带有限的语义内容,但仍积累了不成比例的注意力。 SAGE 利用这些词元作为锚点来实时监控视觉依据可靠性。在每个注意力汇聚词元触发处,该方法从生成的序列中提取语义概念,使用自注意力图和基于梯度的归因来估计它们的视觉依据,并测量它们的空间一致性。基于该信号,自注意力分布会自适应地锐化或加宽,以加强有视觉依据的区域或抑制不可靠的区域。跨不同幻觉基准的广泛实验表明,SAGE 始终优于现有的解码策略,在保留描述性覆盖范围的同时大幅减少幻觉,无需模型重新训练或架构修改。我们的方法在不同的 VLM 架构中,在 MSCOCO 上实现了 10.65% 的平均相对改进,在 AMBER 上实现了 7.19% 的平均相对改进,证明了幻觉缓解方面的持续收益。