论文

Sparrow:稀疏部署,实现 大语言模型 稳定高效的长上下文强化学习

Sparrow: Sparse Rollout for Stable and Efficient Long-context RL of Large Language Models

模型训练强化学习

摘要

尽管功能强大,但具有可验证奖励的强化学习(RLVR)会导致极长的 COT,使其计算成本高昂。由于 RLVR 每步成本主要由长上下文 rollout 生成决定,因此稀疏注意力为加速密集 rollout 提供了一种有前途的方法。然而,稀疏执行轨迹需要微妙的稳定性与效率权衡:过于激进的稀疏性会导致崩溃,而过于宽松的稀疏性会导致加速不足。在这项工作中,我们通过稀疏到密集的参与者策略不匹配来研究这种权衡。我们首先观察到,稀疏执行轨迹崩溃并不是由词元之间的统一降级驱动的:即使在极度稀疏的情况下,大多数稀疏词元也与密集词元完美对齐。受此启发,我们假设,如果每个词元参与者策略不匹配的下尾部在整个轨迹中保持在临界阈值以上,那么稀疏执行轨迹训练将保持稳定。我们引入了动态稀疏性计划,可以在生成过程中保持尾部统计量恒定并验证我们的假设。在 Qwen3 思维家族模型中,将尾部失配统计量保持在一致阈值附近通常可以实现稳定的训练。然后,我们使用成本模型来找到在此不匹配阈值下最大加速的稀疏计划,在训练 Qwen3-1.7B、Qwen3-4B 和 Qwen3-8B 时实现 2.2 倍、2.4 倍和 2.0 倍的执行轨迹加速。根据经验,我们将阈值推广到更大的模型 (Qwen3-14B) 和另一个 RL 域(编码)。最后,我们的分析自然会激发 DistillSparse:稀疏执行轨迹时基于 LoRA 的轻量级 蒸馏 可以让更激进的稀疏性达到相同的稀疏到密集不匹配阈值,从而产生更高的加速。