论文
ESPO:提前停止近端策略优化
ESPO: Early-Stopping Proximal Policy Optimization
摘要
当强化学习下的 大语言模型 在轨迹的早期犯下错误的推理步骤时,标准算法会强制它继续生成直到最大范围,将计算花费在从未获得正奖励的词元上,并用失败后噪声污染优势估计。我们提出 ESPO(提前停止近端策略优化),它可以动态检测轨迹故障并提前终止轨迹采样。在每个生成步骤中,ESPO 仅使用采样期间已计算出的 logits 来计算替代后悔,并在平滑后的累积后悔显着超过其估计值时终止。截断的轨迹被视为具有最终奖励的吸收失败状态,将负时间差异(TD)错误集中在检测到的失败步骤附近,而无需任何额外的奖励模型或人工注释。在经过数学推理训练的 DeepSeek-R1-Distill-Qwen-7B 上,ESPO 在 AIME~2024(46.28% vs. 45.25%)、AMC~2023(85.83% vs. 82.94%)和 MATH-500(87.42% vs. 85.43%)上超过了 PPO,同时节省了超过 20% 的轨迹采样词元累计。