论文

Le Critique:LLM 强化学习的特权值函数

Le Critique: Privileged Value Functions for LLM Reinforcement Learning

模型训练强化学习

摘要

大语言模型 (LLM) 的强化学习算法的主要区别在于其方差减少策略。 GRPO 等与组相关的方法通过对每个提示的多次轨迹采样进行采样来减少梯度方差,但仅提供序列级信用。拖慢整体速度的采样轨迹也会阻碍训练,从而降低吞吐量并增加偏离策略。学习价值函数理论上可以解决这两个问题,无需大型群体即可提供 词元级 优势。然而,额外的基础设施工程挑战加上无批评方法的实际成功,使得很难证明它们包含在强化学习管道中是合理的。我们提出了两种互补策略来提高价值函数 RL 的性能:1)特权价值函数(PVF),它提供了一种优雅的机制来注入额外的与任务相关的 词元级 信号,而不会使政策目标产生偏差; 2) TETHER,根据价值函数精度在组相对基线和价值基线之间自适应插值的基线。在多个推理任务中,两种策略都持续改进标准价值函数基线,并且与平均基线 GRPO 竞争或优于平均基线 GRPO。