论文

突破瓶颈:多头潜在注意力如何将语言模型中的内容与位置分开

Through the Bottleneck: How Multi-head Latent Attention Separates Content from Position in Language Models

模型评测模型行为与机制分析

摘要

DeepSeek-V2 中引入的多头潜在注意力 (MLA) 通过共享低秩瓶颈 (cKV) 压缩键值对,在推理过程中实现了 81% 的 KV 缓存减少。尽管它在大规模生产模型中得到采用,但之前没有研究过该瓶颈保留或丢弃哪些信息,也没有研究它如何重塑内部 Transformer 电路。我们提出了 MLA 的第一个全面的机械可解释性研究,训练了 114M 参数的 Transformer(在网络/代码/数学混合上进行预训练,在 TinyStories 上进行了微调),并通过 SVD、注意力头分类法、线性探测和中断归因分析来分析其表示。我们的主要发现是:(1)cKV 瓶颈学习纯粹的内容表示,保留实体身份(98% 保留),同时丢弃位置信息,验证 MLA 通过 RoPE 将内容与位置分离; (2) 感应头共位于单层(第 12 层),这与标准 MHA 中的分布式结构不同; (3)单个“语义中心”层(第15层)同时表现出最高的SVD有效排名和最强的破坏归因得分; (4) 瓶颈是全局配置过剩,平均容量仅使用了46%。这些发现表明 MLA 不仅被动地压缩注意力,而且重塑了模型组织内容、位置和回​​路结构的方式。我们将此视为第 5 节中的初始数据点和详细范围限制。