论文

Search-R2:通过 Actor-Refiner 协作增强搜索融合推理

Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration

模型训练强化学习RLVRAgentic RL

摘要

搜索融合推理使语言智能体能够通过主动查询外部来源,超越静态的参数化知识。然而,用强化学习训练这类智能体受到多尺度贡献归因问题的阻碍:现有方法通常依赖稀疏的轨迹级奖励,无法区分高质量推理与侥幸猜中,导致冗余或误导性的搜索行为。为解决这一问题,我们提出 Search-R2,一个新颖的 Actor-Refiner 协作框架,通过有针对性的干预增强推理,两个组件在训练期间联合优化。我们的方法把生成过程分解为 Actor 与 Meta-Refiner:前者产生初始推理轨迹,后者通过“切除并再生成”机制有选择地诊断并修复有缺陷的步骤。为提供细粒度监督,我们引入混合奖励设计,把结果正确性与量化检索证据信息密度的密集过程奖励相耦合。在理论上,我们把 Actor-Refiner 交互形式化为平滑混合策略,证明有选择的纠错相比强基线带来严格的性能增益。在多个通用与多跳问答数据集上的大量实验表明,Search-R2 在各模型规模上持续优于强大的 RAG 与基于 RL 的基线,以极小开销取得更优的推理准确率。

Search-R2:通过 Actor-Refiner 协作增强搜索融合推理
图2:Search-R2 框架概览。Actor 生成带有搜索查询的初始推理轨迹。Meta-Refiner 使用 Discriminator 检测错误,并使用 Trimmer 定位出错的确切步骤。一旦被拒绝,轨迹会被截断并从错误点重新生成。系统通过 GRPO 使用混合奖励进行联合优化。