论文

OR Else:策略优化中的可微信赖域

OR Else: A Differentiable Trust Region for Policy Optimization

模型训练强化学习

摘要

本文研究的PPO与GRPO基线采用截断替代目标,沿有利方向的饱和会使标量目标导数突然变化。论文考察平滑单侧饱和规则Output Reset(OR,输出重置)能否改善大语言模型后训练。PPO-OR与GRPO-OR在相对采样策略的词元对数概率比空间中,用OR平方间隔损失替换截断策略项;优势的符号决定更新方向,词元越过有利间隔后,不再贡献直接OR残差。 作者在Anthropic的hh-rlhf数据上使用Llama-3.2-1B-Instruct、同一个奖励模型和每种方法三个随机种子,分别比较广义优势估计(GAE)下的PPO-clip与PPO-OR,以及组相对优势下的GRPO与GRPO-OR。在GAE设置中,PPO-OR最终训练奖励模型得分的均值高0.305,但种子间波动更大。在组相对优势设置中,GRPO-OR平均得分没有提高,不过波动更小、终态OR残差接近零、超调比例下降;匹配的GRPO截断目标轨迹仍有波动。 两种组相对方法从采样策略到当前策略的对数概率比偏移都明显大于GAE方法,OR没有稳定减少这一偏移。因此,OR在两组比较中都改变了优化行为,但奖励效果不同。在组大小G=2时,GRPO-OR的诊断指标改善没有转化为奖励得分提升,更大组是否改变结果尚未确定。所报告得分是训练期间的奖励模型测量,不是留出集上的人类偏好表现。