论文
大型视觉语言模型迷失于注意力
Large Vision-Language Models Get Lost in Attention
摘要
尽管训练范式快速演化,大型视觉语言模型(LVLM)的解码器骨干本质上仍根植于残差连接Transformer架构。因此,厘清内部模块的不同角色对理解模型机制与指导架构优化至关重要。既往统计方法提供了有价值的归因洞见,但常缺乏统一理论基础。为弥合差距,我们提出一个扎根信息论与几何的统一框架,量化残差更新的几何与熵性质。应用该统一框架揭示一个基本的功能解耦:注意力是保子空间算子,专注重配置;FFN是扩子空间算子,驱动语义创新。惊人地,进一步实验显示:用预定义值(如高斯噪声)替换习得的注意力权重,在多数数据集上产生与原模型相当甚至更优的性能。这些结果暴露当前机制中严重的错配与冗余,提示SOTA的LVLM实际上「迷失于注意力」,而非高效利用视觉上下文。
