论文
全注意力的反击:在数百个训练步骤中将全注意力转变为稀疏注意力
Full Attention Strikes Back: Transferring Full Attention into Sparse within Hundred Training Steps
摘要
大语言模型 中的长上下文推理受到完全注意力的二次成本的瓶颈。现有的高效替代方案通常依赖于本机稀疏训练或启发式词元驱逐,从而在效率、训练成本和准确性之间产生不良的权衡。在这项工作中,我们证明了全注意力 LLM 本质上已经是稀疏的,并且只需最小的适应就可以转换为高度稀疏的模型。我们的方法基于三个观察:(1)只有一小部分注意力头真正需要完整的长上下文处理; (2) 远程检索主要由低维子空间控制,允许使用 16 维索引器有效检索相关标记; (3) 有用的 词元预算 强烈依赖于查询,使得动态 top-$p$ 选择比固定 top-$k$ 稀疏化更合适。基于这些见解,我们提出了 RTPurbo,它只为检索头保留完整的 KV 缓存,并引入了用于稀疏注意力的轻量级词元索引器。通过利用模型的内在稀疏性,RTPurbo 只需几百个训练步骤即可实现稀疏化。长上下文基准测试和推理任务的实验表明,RTPurbo 保留了近乎无损的准确性,同时提供了显着的效率增益,包括在 1M 上下文下高达 9.36$\times$ 的预填充加速和约 2.01$\times$ 的解码加速。这些结果表明,可以从标准的全注意力训练中获得强稀疏推理,而无需昂贵的本机稀疏预训练。