论文
跳过连接策略优化以获得隐性优势
Skip-Connected Policy Optimization for Implicit Advantage
摘要
事实证明,组相对策略优化 (GRPO) 通过使用基于结果的奖励在 RLVR 中有效。虽然细粒度的密集奖励理论上可以提高性能,但我们发现,在实际抽样预算下,蒙特卡罗估计为早期推理词元带来了高方差和符号不一致的优势,矛盾的是,其表现低于仅结果的 GRPO。我们提出了跳过连接优化(SKPO),它将推理分解为上游和下游阶段:上游通过单流优化从下游蒙特卡罗采样中获得密集奖励;下游保持组相对优化,其中跳过连接将上游段与原始问题连接起来,使模型能够利用有用的上游推理,同时保留通过直接问题访问绕过有缺陷的推理的自由。实验表明,在数学基准和域外任务(包括一般推理和代码生成)中,Qwen2.5-Math-7B 和 Llama-3.2-3B 的最强基线分别提高了 3.91% 和 6.17% 的相对增益。进一步的分析揭示了一个隐含的优势:即使与最终正确性匹配,SKPO 也会生成具有更高中间步骤质量的轨迹。