论文
SPPO:面向长程推理任务的序列级PPO
SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks
摘要
近端策略优化(Proximal Policy Optimization, PPO)是在可验证奖励的推理任务中对齐大语言模型(LLM)的核心方法。然而,标准token级PPO在这种设定下举步维艰,原因在于长思维链(Chain-of-Thought, CoT)范围内时序贡献归因的不稳定性,以及价值模型高昂的内存成本。虽然GRPO等无需价值评估器(critic-free)的替代方案缓解了这些问题,但它们需要多次采样来估计基线,带来可观的计算开销,严重限制训练吞吐量。本文提出序列级PPO(SPPO),一个可扩展的算法,调和了PPO的样本效率与基于结果更新的稳定性。SPPO将推理过程重新表述为序列级上下文老虎机问题,采用解耦的标量价值函数,无需多次采样即可导出低方差优势信号。在数学基准上的大量实验表明,SPPO显著超越标准PPO,并匹配计算开销沉重的组级(group-based)方法的性能,为对齐推理LLM提供了一个资源高效的框架。
