论文

当汇有帮助还是有害时:大型视觉语言模型中注意力汇的统一框架

When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models

模型评测模型行为与机制分析

摘要

注意力池被定义为吸引过多注意力的词元。虽然这些已经在单一模态 Transformer 中进行了研究,但它们在大视觉语言模型(LVLM)中的跨模态影响在很大程度上仍未被探索:它们是多余的工件还是重要的全局先验?本文首先将视觉接收器分为两个不同的类别:ViT 出现的接收器(V-sinks),它从视觉编码器传播,以及 LLM 出现的接收器(L-sinks),它出现在深层 LLM 层中。基于新的定义,我们的分析揭示了一个基本的性能权衡:虽然接收器有效地编码了全局场景级先验,但它们的主导地位可以抑制局部感知所需的细粒度视觉证据。此外,我们还确定了调节这些接收器对下游性能影响最显着的特定功能层。为了利用这些见解,我们提出了分层 Sink Gating (LSG),这是一种轻量级、即插即用的模块,可以动态缩放 V-sink 和其余视觉标记的注意力贡献。 LSG 通过标准的下一个词元预测进行训练,不需要特定于任务的监督,同时保持 LVLM 主干冻结。在大多数层中,LSG 在代表性多模态基准上产生了改进,有效地平衡了全局推理和精确的本地证据。