论文
离策略 大语言模型 基于价值的强化学习
Off-Policy Value-Based Reinforcement Learning for Large Language Models
摘要
提高数据利用效率对于扩展强化学习 (RL) 的长期任务至关重要,因为生成轨迹的成本很高。然而,LLM 的主要 RL 方法主要是 同策略:它们只更新每批数据一次,丢弃它,然后收集新鲜样本,导致样本效率较差。在这项工作中,我们为 LLM 探索了一种替代的基于价值的 RL 框架,它自然地支持 离策略 学习。我们提出了 ReVal,一种基于贝尔曼更新的方法,它将捕获内部一致性的逐步信号与从结果验证中得出的轨迹级信号相结合。 ReVal 自然支持基于重放缓冲区的训练,允许有效地重用过去的轨迹。标准数学推理基准测试表明,ReVal 不仅收敛速度更快,而且最终性能优于 GRPO。在 DeepSeek-R1-Distill-1.5B 上,ReVal 提高了训练效率,与 GRPO 相比,AIME24 提高了 2.7%,域外基准 GPQA 提高了 4.5%。这些结果表明,基于价值的强化学习是 LLM 训练中基于策略的方法的实用替代方案。