论文

将语义注意力与注意力流形中的结构偏差分离开来

Disentangling Semantic Attention from Structural Bias in the Attention Manifold

模型推理解码与生成控制

摘要

多模态 大语言模型 (MLLM) 中注意机制的实证成功常常掩盖了其固有的、微妙的缺陷。具体来说,MLLM 始终表现出对某些语义上无信息的视觉标记的不成比例的关注,这种现象称为“注册”或“视觉注意力下沉”。虽然现有的推理干预方法试图识别这些接收器标记并重新分配它们的注意力权重,但此类方法通常单独处理这些标记并遭受计算效率低下的困扰。相反,我们将这种现象重新定义为对视觉特征施加的广义文本偏见,其范围超出了孤立的接收器标记。从这个角度来看,普遍的结构偏差会导致语义视觉信号的稀释,从而引发多模态幻觉,因为模型优先考虑语言先验而不是有效的视觉证据。为了解决这一限制,我们引入了显着性引导的纯化和自适应重新分配(SPAR),这是一种 无需训练 即插即用干预。 SPAR 通过净化结构噪声并随后将回收的注意力预算重新分配到信息最丰富的视觉区域来减轻这种广义文本偏差。对各种幻觉基准的综合评估表明,SPAR 可以有效地恢复真实的视觉基础,而计算开销可以忽略不计。