论文
语言模型边际注意力空间中的涌现结构
Emergent Structure in the Marginal Attention Space of Language Models
摘要
虽然跨独立训练语言模型的表示相似性已被充分记录,注意力等内部机制如何跨模型表现仍少有刻画。受此缺口启发,我们通过在查询位置上边际化来考察softmax后注意力权重的结构,把它们映射进联合的token×头"边际注意力空间"。跨60余个多样LLM评估发现:沿token轴与头轴约化该空间时涌现不同性质。按token约化时,边际注意力给出跨模型鲁棒守恒的文本内在信号;为解释该性质,我们把边际注意力与网络的输入-输出Jacobian经验联系,并理论上证明在光滑性假设下,下一token分布相似的模型必有相似的输入-输出Jacobian统计。按头约化时,它形成跨文档守恒的模型私有签名。实践上,这为KV缓存驱逐的每头预算估计提供自然方式——把模型特定预算分配与文本内在token打分有效解耦。标准驱逐基准上,在预训练文本上离线预计算的每头预算加训练自由token分数,与每个文档重算预算或按目标训练的方法性能相当。代码/项目页:https://github.com/Flegyas/marginal-attention。