论文
架构感知强化学习使滑窗注意力在数学推理中具竞争力
Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning
摘要
推理和代理大语言模型(LLM)的快速进步增加了对长上下文推理的需求,但自注意力(SA)与上下文长度成二次方缩放。为了解决这个问题,我们研究了 SWARR(数学推理强化适应滑动窗口注意力),这是一种使 SWA 模型适应数学推理的实用方法。 SWARR 有两个阶段:(1)通过监督微调(SFT)从预训练的 SA 模型到 SWA 的有效转换,这避免了预训练新的基础模型;(2)通过强化学习(RL)进行策略适应。我们发现 SWA 在 SFT 之后仍然表现不佳,我们假设这种差距部分是由数据架构不匹配造成的:大多数 SFT 数据都是为 SA 模型准备的,并且可能包含 SWA 难以建模的远程依赖关系。由于同策略 RL 在 SWA 约束下优化自生成轨迹,因此它可以调整轨迹以更好地匹配 SWA。数学推理基准实验表明,该方法大大缩小了 SWA 和 SA 之间的差距,恢复了 SWA 转换期间损失的大部分准确性,同时保留了线性复杂性注意力的效率优势。我们的核心贡献是实证发现,RL 改变了人们仅从转换和 SFT 得出的有关 SWA 数学推理可行性的结论。
