论文

混合线性注意力 大语言模型 中的大量激活:注意前尖峰和尖峰间平台

Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus

模型评测模型行为与机制分析

摘要

我们首次对层交错混合线性注意力 大语言模型 (HLA LLM) 中的大规模激活 (MA) 进行系统研究,检查其架构组织、训练时出现、底层机制和功能意义。在五种线性注意力架构、六种混合配置和五个输入域中,我们确定了两种与架构一致的形态:完全注意力之前的预注意力尖峰(PAS)和通过介入线性注意力层持续存在的尖峰间平台(ISP)。更密集的全注意力越来越多地通过 ISP 连接 PAS,接近传统 Transformer 的持久 MA。该组织还跨越 1.2B-397B 参数的 12 个公共检查点重复出现,涵盖线性注意力和状态空间混合。高达 1.3B 的门控 DeltaNet (GDN) 混合体的受控预训练揭示了两种形态的早期出现和巩固,以及不对称的门控效应。具体来说,全注意力输出门会在不消除其组织的情况下强烈减弱 MA 幅度,而移除 GDN 输出门会产生适度的放大。从机制上讲,我们开发了一个共享的系统异常值账户:PAS遵循本地化的写入-接收-取消过程,而ISP则与延迟取消一致。从功能上来说,我们的干预措施表明,相对于正常推理,在每个全注意力输入处仅删除四个最大幅度的 PAS 坐标会降低平均下游准确度 21.9%-63.6%。此外,参考条件的峰值到平台连接持续提高平均现实世界检索精度,无需重新训练即可产生 1.1%-12.6% 的相对增益。我们的代码可从 https://github.com/StartLuxLabs/Massive-Activations-HLA 获取。