论文

CoSearch:通过强化学习联合训练推理与文档排序以实现智能体搜索

COSEARCH: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search

模型训练强化学习RLVRAgentic RL

摘要

智能体搜索(agentic search)——即训练智能体迭代地推理、发出查询并综合检索到的信息以回答复杂问题的任务——已通过强化学习(Reinforcement Learning,RL)取得显著进展。然而,Search-R1等现有方法将检索系统视为固定工具,仅优化推理智能体,而检索组件保持不变。一项初步实验显示,在七个QA基准上,oracle检索系统与固定检索系统之间的差距最高可达+26.8%的相对F1提升,这表明检索系统是扩展智能体搜索性能的关键瓶颈。受此发现启发,我们提出CoSearch,一个通过Group Relative Policy Optimization(GRPO)联合训练多步推理智能体与生成式文档排序模型的框架。为了使排序器(其输入随推理轨迹而变化)能够进行有效的GRPO训练,我们引入一种语义分组策略,按token级相似度对子查询进行聚类,无需额外rollout即可形成有效的优化组。我们进一步设计了一种将排序质量信号与轨迹级结果反馈相结合的复合奖励,为排序器提供即时与长期两类学习信号。在七个单跳与多跳QA基准上的实验表明,该方法相对强基线取得一致的改进,消融研究验证了每一项设计选择。我们的结果表明,联合训练推理智能体与检索系统既可行又性能强劲,为未来的搜索智能体指明了一个关键要素。

CoSearch:通过强化学习联合训练推理与文档排序以实现智能体搜索
图 1:两个面板共享相同的架构:Main Agent → \to Retriever → \to Ranker。上图:现有方法将整个检索系统视为固定的 ( ) 并仅训练主代理。底部:CoSearch 将检索系统分解为固定的密集检索器和可训练的生成排序器 ( ),通过 GRPO 联合优化主代理和排序器。