论文

SearchMaster:有证据支撑与约束的搜索Agent自博弈

SearchMaster: Grounded and Regulated Self-Play for Search Agents

模型训练强化学习RLVRAgentic RL

摘要

使用基于LLM的搜索代理进行训练需要高质量的搜索数据:任务要求进行真实的多跳检索,使用搜索工具的有效轨迹。现有的管道通常依赖于人工编写的任务、专家演示或更强的教师模型。我们提出了SearchMaster,这是一种自学习框架,从生成的任务、解决的任务和验证的任务中训练单个LLM。关键挑战是自动生成的任务和轨迹可能会产生误导信号:伪多跳问题、忽略搜索深度的成功率估计以及过度打开但缺乏针对性证据获取的轨迹。SearchMaster通过三个控制来解决这些失败模式:证据链生成器(ECG)将任务生成基于明确的跨文档证据链,以减少伪多跳问题。搜索深度奖励(SDR)根据成功的轨迹搜索深度评分任务难度,而不是单纯的成功率,保持保留的任务搜索密集。过度打开惩罚(OOP)通过鼓励避免过度文档打开,避免长但浅的浏览,从而避免过度打开。然后,验证的提议者和解决者轨迹被联合优化与GRPO。在六个深度搜索基准测试中,SearchMaster将Qwen3.5-9B的平均准确率从38.19%提高到51.52%,在BrowseComp-Plus上增加了30.1个点。这些结果表明,基于证据和监管的自学习可以提供有效的搜索代理训练数据,而无需人工标注的QA对或专家演示。代码可在https://github.com/WentaoTan/SearchMaster处获取。

SearchMaster:有证据支撑与约束的搜索Agent自博弈:论文配图
图1:SearchMaster 如何使任务有证据支撑并约束行为。(a) ECG 构建明确的证据链,减少伪多跳问题。(b) SDR 奖励更深入且成功的执行轨迹,促进多步搜索。(c) OOP 惩罚过度打开文档,减少冗长却浅层的浏览。