论文

大型视觉语言模型迷失于注意力

Large Vision-Language Models Get Lost in Attention

模型评测模型行为与机制分析

摘要

尽管训练范式快速演化,大型视觉语言模型(LVLM)的解码器骨干本质上仍根植于残差连接Transformer架构。因此,厘清内部模块的不同角色对理解模型机制与指导架构优化至关重要。既往统计方法提供了有价值的归因洞见,但常缺乏统一理论基础。为弥合差距,我们提出一个扎根信息论与几何的统一框架,量化残差更新的几何与熵性质。应用该统一框架揭示一个基本的功能解耦:注意力是保子空间算子,专注重配置;FFN是扩子空间算子,驱动语义创新。惊人地,进一步实验显示:用预定义值(如高斯噪声)替换习得的注意力权重,在多数数据集上产生与原模型相当甚至更优的性能。这些结果暴露当前机制中严重的错配与冗余,提示SOTA的LVLM实际上「迷失于注意力」,而非高效利用视觉上下文。

大型视觉语言模型迷失于注意力:论文配图
图 1:我们的可解释性框架概述:(a) LVLM 残余流; (b) 𝐗\mathbf{X} 中的表示信息,其中 SVD 产生频谱 𝒮𝐗\mathcal{S}_{\mathbf{X}} 和语义支持 𝒟𝐗\mathcal{D}_{\mathbf{X}}; (c) Δ​𝐗\Delta\mathbf{X} 的更新级别影响,通过用于创新的 RID 和用于重新配置的 MixIG 进行量化; (d) 逐层功能分解,揭示了一种正交分工,其中注意力充当子空间保留算子,FFN 充当子空间扩展算子。