论文

SPPO:面向长程推理任务的序列级PPO

SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks

模型训练强化学习RLVR

摘要

近端策略优化(Proximal Policy Optimization, PPO)是在可验证奖励的推理任务中对齐大语言模型(LLM)的核心方法。然而,标准token级PPO在这种设定下举步维艰,原因在于长思维链(Chain-of-Thought, CoT)范围内时序贡献归因的不稳定性,以及价值模型高昂的内存成本。虽然GRPO等无需价值评估器(critic-free)的替代方案缓解了这些问题,但它们需要多次采样来估计基线,带来可观的计算开销,严重限制训练吞吐量。本文提出序列级PPO(SPPO),一个可扩展的算法,调和了PPO的样本效率与基于结果更新的稳定性。SPPO将推理过程重新表述为序列级上下文老虎机问题,采用解耦的标量价值函数,无需多次采样即可导出低方差优势信号。在数学基准上的大量实验表明,SPPO显著超越标准PPO,并匹配计算开销沉重的组级(group-based)方法的性能,为对齐推理LLM提供了一个资源高效的框架。

SPPO:面向长程推理任务的序列级PPO:论文配图
图1:“尾部效应”分析。我们可视化 Critic 值动态 V⁡(st)V(s_{t}) 来诊断低效率。蓝线和红线分别表示正确和错误的轨迹。批评家仅在序列尾部附近进行区分。对于正确的路径,V⁡(st)V(s_{t})上升较晚,导致A^t\hat{A}_{t}消失;对于不正确的步骤,它不会惩罚中间步骤。这表明信用分配是基于令牌位置而不是语义贡献。 Critic 在 8192 上下文窗口下进行训练。附录 B 中提供了其他随机采样的可视化效果。