论文

带有深度研究代理搜索规则的训练文档重新排序器

Training Documents Reranker with Search Rubrics for Deep Research Agent

模型训练强化学习

摘要

检索系统通过提供相关文档帮助深度研究人员生成高质量的答案。然而,现有的检索器通常通过相关性匹配来选择文档,而单独匹配良好的top-$k$文档可能无法形成满足代理查询的复杂信息需求的\textit{set}(\例如,多样化、简洁和权威的文档)。在本文中,我们提出了面向搜索的规则,\textit{显式}定义了每个代理查询高质量文档集应满足的要求。我们的搜索规则被组织成分层结构,并使用强大的 LLM 进行综合。基于这些搜索规则,我们进一步训练文档重新排序器 \textbf{RubricRanker} 以从检索到的文档中选择高质量的子集。我们设计了一个两阶段的训练框架,其中包括评分细则引导的监督 微调 和基于评分细则的强化学习。大量实验表明,RubricRanker 在四个深度研究基准上比最强基线高出 2.6 个点,并且可以很好地推广到五个 RAG 基准。