论文
SIPO:树结构 Agentic RL 的选择性推理策略优化
SIPO: Selective-Inference Policy Optimization for Tree-Structured Agentic RL
摘要
树结构强化学习通过比较替代延续并将终端奖励传播到中间决策来训练搜索Agent。然而,自适应扩张会造成统计上的不对称:使用自己的生成统计数据来选择现任者,而新的兄弟姐妹则在选择后进行抽样。当该统计数据与返回相关联时,分支值可以反映选择历史记录以及延续质量,即使对于共享父级也是如此。我们提出选择性推理策略优化 (\SIPO{}),它将这种区别纳入基于树的信用估计中。其无标度分支标准使生成分数和兄弟惩罚保持在一致的相对范围内;可交换分支从每个选定的父代提供多个新的延续;顺序统计校正使用选择排名和估计分数-结果关联来调整保留的现有值。这些机制保留了叶子预算和宿主策略优化目标。在使用 Qwen3-4B、Qwen3-8B 和 Qwen2.5-7B 的七个 QA 基准测试中,\SIPO{} 在比较方法中实现了报告的最高多跳和单跳平均值。在 Qwen3-8B 上,它比 AT\textsuperscript{2}PO 的平均值分别提高了 1.31$ 和 1.07$ 个百分点,并且在七个基准测试中的六个中排名第一。组件消融评估个体和组合的变化,而早期训练配对诊断显示被选中的既有分支与新采样分支之间的价值差距,以及接近零的新采样分支间参考差距。总之,这些结果支持在构建和评估搜索Agent的rollout时考虑选择历史记录。我们的代码可在 https://github.com/Zenghuang-Fu/SIPO 获取