论文
注意力编辑:跨架构注意力转换的多功能框架
Attention Editing: A Versatile Framework for Cross-Architecture Attention Conversion
摘要
在长上下文和长生成机制中,键值 (KV) 缓存内存和带宽日益主导 大语言模型 推理成本。多头潜在注意力(MLA)和混合滑动窗口注意力(SWA)等架构可以缓解这种限制,但将它们集成到现有模型中仍然很困难。现有方法对源注意力模块和目标注意力模块都提出了细粒度的结构要求,无法满足实际部署中的可行要求。我们提出了注意力编辑,这是一个实用的框架,用于将已经训练的 大语言模型 (LLM) 转换为新的注意力架构,而无需从头开始重新预训练。注意力编辑用可学习的目标模块替换原始注意力,并使用渐进式 蒸馏 对其进行训练,包括(1)具有中间激活监督的分层教师强制优化,以防止冷启动错误累积,以及(2)下一个词元分布上的模型级 蒸馏,可选地通过弱特征匹配进行正则化。我们在两个不同的目标——MLA 和 GateSWA(门控混合 SWA 设计)上实例化该框架,并将其应用于 Qwen3-8B 和 Qwen3-30B-A3B。由此产生的模型保持了具有竞争力的性能,同时显着提高了效率,证明大规模注意力转换既可行又稳健。值得注意的是,实验是在Ascend 910B集群上进行的,为国产硬件提供了实际的训练案例。