论文
超越结果奖励:深度搜索代理的阶梯式自提策略优化
Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents
摘要
深度搜索代理在跨越数十个步骤的轨迹上运行,但标准强化学习仅为每个轨迹提供单个结果奖励,这对于有效的信用分配来说太稀疏了。 同策略自蒸馏 (OPSD) 通过使用模型自己的 logits 作为密集的 词元级 教师来解决这个问题,但将其扩展到搜索代理会引入根本性的张力:教师可以访问正确答案等特权信息,产生的分布与学生基于探索的推理和朴素的 蒸馏 系统地不同导致学生继承这种信息不对称,而不是学习更好的搜索策略。我们通过两项贡献解决了这种紧张局势。首先,我们构建证据锚点,它是从网络中提取的简洁的、步骤级的证据片段,作为捕获关键推理步骤而不泄露整个答案路径的特权信息。其次,我们提出了阶梯级自蒸馏策略优化(SSPO),它将师生分歧转化为 GRPO 内的阶梯级优势权重,专门应用于不正确的轨迹。这种设计将更新内容与更新多少分离开来:结果奖励决定了政策变化的方向,而教师则在每一步调整其幅度。正确的轨迹保持不变,保留了它们的多样性。在 Qwen3-8B 上,SSPO 在 BrowseComp、GAIA 和 FRAMES 上始终优于 GRPO,超越或匹配使用两倍梯度步数训练的 GRPO,而单个额外前向传递每步仅增加约 5% 的开销。