论文

SmartSearch:面向搜索Agent的过程奖励引导查询精炼

SmartSearch: Process Reward-Guided Query Refinement for Search Agents

模型训练奖励建模与过程监督

摘要

基于大型语言模型(LLM)的搜索Agent通过引入信息检索能力,在解决知识密集型问题方面展现出前景。现有工作大多聚焦于优化搜索Agent的推理范式,而对推理过程中间搜索查询的质量仍然忽视。其结果是,生成的查询往往不准确,导致意料之外的检索结果,最终限制了搜索Agent的整体效果。为缓解这一问题,我们提出SmartSearch,一个建立在两个关键机制之上的框架:(1)过程奖励,通过双层信用评估为每条中间搜索查询的质量提供细粒度监督;(2)查询精炼,通过选择性地精炼低质量的搜索查询,并基于这些精炼结果重新生成后续搜索轮次,来促进查询生成的优化。为让搜索Agent在过程奖励引导下逐步内化提升查询质量的能力,我们设计了一个三阶段课程学习框架,引导Agent经历从模仿、到对齐、最终到泛化的进阶。实验结果表明,SmartSearch持续超越现有基线,额外的定量分析进一步证实了它在搜索效率和查询质量上的显著增益。代码已发布于https://github.com/MYVAE/SmartSearch。

SmartSearch:面向搜索Agent的过程奖励引导查询精炼 配图
图 3:面向查询的三阶段课程学习总体框架,包括查询质量筛选的模仿学习(Query Quality Screened Imitation Learning)、查询生成对齐(Query Generation Alignment)与查询生成对齐(Query Generation Alignment)。