论文
离策略 GRPO 可以如何? Mu-GRPO 实现高效 LLM 强化学习
How Off-Policy Can GRPO Be? Mu-GRPO for Efficient LLM Reinforcement Learning
摘要
组相对策略优化 (GRPO) 一直是 大语言模型 的可验证奖励强化学习 (RLVR) 最新进展的关键驱动力,但它通常是在低陈旧、接近 同策略 的机制中进行训练,这会产生大量的系统开销。我们问一个简单的问题:GRPO 可以是 离策略 吗?我们证明了 GRPO 风格的算法可以容忍比之前假设的大得多的采样轨迹过时程度,并提出了 Mu-GRPO,这是一种 RL 训练框架,它将训练组织成少量(例如四个)大型连续生成优化阶段。这种设计会导致较高的轨迹过时程度,同时大大减少转出优化切换开销。为了稳定陈旧数据下的学习,Mu-GRPO 结合了宽松的裁剪(保留有用的陈旧采样轨迹梯度)和负优势否决(消除了负优势响应中不稳定的触发后后缀更新)。在五种语言模型和多个数学推理基准中,Mu-GRPO 的性能达到或超过了标准 GRPO 的性能,同时在挂钟训练时间上实现了约 2 倍的加速,为 LLM 强化学习建立了显着改进的性能与效率权衡。