论文
注意力路由尽早稳定:循环语言模型的工作集推理
Attention Routing Stabilizes Early: Working-Set Inference for Recurrent Language Models
摘要
循环语言模型重复应用共享网络块来细化潜在表示,但标准推理会在每个循环步骤重新计算全局注意力。我们研究了循环深度的注意力动态,发现注意力支持和分布比隐藏状态和注意力输出更早稳定。这表明了一个两阶段的结构:早期的步骤发现相关上下文的稀疏工作集,而后面的步骤则在基本相同的路由支持上细化表示。受这种结构的启发,我们引入了 WISE(带有支持利用的工作集推理),这是一种免训练方法,在早期循环过程中使用不受限制的全局注意力,然后重用直接发现的块结构支持,同时保持循环深度和支持内注意力计算动态。受控干预表明,重复发现很重要,并且仅支持重用比更具限制性的注意力重用替代方案更好地保留了模型行为。在多跳 QA 基准测试中,WISE 在很大程度上保留了全注意力性能,而上下文扩展则揭示了工作集日益稀疏和效率提高。 2K 环境下的质量在很大程度上得以保留,但在 4K 环境下会出现明显的损失。优化的稀疏注意力实现在 4K 下实现了比原生 FlashAttention 高达 1.76 倍的注意力加速,以及完整 32 步注意力轨迹的 1.36 倍加速。我们的代码可以在这个 https URL 上找到。