论文
LLM RL 的值梯度假设
Value-Gradient Hypothesis of RL for LLMs
摘要
强化学习极大地改善了预训练的语言模型,但仍然没有充分研究为什么像 PPO 和 GRPO 这样的无评论家网络方法能够发挥作用,以及它们何时应该提供最大的收益。我们为 LLM 后训练 开发了无评论家网络强化学习的价值梯度视角。首先,在可微分采样轨迹和加性噪声参数化下,我们表明策略网络更新在期望中是类似值梯度的:向后传递传播其条件期望等于值梯度的共状态。其次,对于离散的 Transformer 策略,我们表明通过注意力进行自微分会产生近似该值信号的经验成本,误差由采样间隙和策略熵控制。这些结果促使将强化学习的影响分解为价值梯度信号和可达到的奖励空间,从而得出强化学习何时在预训练轨迹上最有效的标准。