论文

KL正则化策略优化

On KL-Regularized Policy Optimization

模型训练强化学习

摘要

大型语言模型 (LLM) Agent的异步强化学习 (RL) 根据另一个策略生成的轨迹训练一个策略:部署来自过时的检查点,即使在相同的参数下,推理引擎的概率也与训练器的概率不同。标准补救措施要么是剪辑重要性比率,这会影响更新,要么如 GRPO 中那样,根据提示对一组响应进行采样,这在剧集较长时成本高昂。我们提出了 KL 正则化策略优化(KLPO),这是一个将 KL 正则化器锚定在采样器上的框架。然后,正则化改进步骤具有闭合形式的吉布斯解,并且KLPO通过采样器自身轨迹上的最小二乘拟合其对数比最优条件,因此采样器概率通过对数比输入并且不需要重要性权重。分析回归截距用信号的采样器均值加上采样器到训练器的 KL 散度取代了棘手的对数划分函数。对于Token级策略镜像下降目标,我们表明,即使在随机工具输出下,也可以通过以采样器为中心的分数或单个轨迹残差,在没有批评者的情况下从终端回报计算出最终的梯度。我们进一步证明 KL 项的独立蒙特卡洛估计保持这些梯度无偏,推导出更便宜的 top-$K$ 和二元近似的精确 KL 差距,并表明 SPPO、GPO、REBEL 和 BPO 作为 KLPO 的特殊情况出现。结果是一个无批评的更新,每个提示使用一次部署,既不需要学习的标准化器也不需要一组响应。