论文
策略滞后下复用采样轨迹:LLM强化学习的前缀归一化策略优化
Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning
摘要
自回归滚动生成在大规模语言模型的强化学习中是一个巨大的计算成本。重复每个滚动批处理以增加学习者的更新次数可以抵消这种成本,但随着学习者偏离行为策略,后续更新会变得越来越非策略性。在词元位置,精确的非策略性校正必须考虑当前动作和到达其前缀的概率。累积重要性比率提供了这种校正,但其乘积形式可以产生一个难以驾驭的动态范围。我们研究前缀-标准化策略优化(PNPO),它将累积比率替换为沿着每个因果前缀的几何平均似然比率,保留因果前缀依赖性,同时压缩权重尺度的对数范围。在控制的长上下文数学推理实验中,我们通过使用每批滚动批中的一个或四个政策更新周期来诱导两个非策略性阶段。PNPO在单个周期时不总是优于GSPO。在四个周期时,它在每个基准点上达到最高的平均@32;三个独立选择的基准点的平均值为50.24,比GSPO高出3.00个百分点。在匹配的2,400次更新预算下,四个周期的PNPO在150批滚动批后达到最终的宏观@32为49.66,与600批滚动批后达到的49.56相当。这些结果为PNPO在训练进一步非策略性时提供初步证据,表明PNPO可能在训练中具有优势。