论文

R$^2$-Searcher:校准代理搜索的检索和推理边界

R$^2$-Searcher: Calibrating Retrieval and Reasoning Boundaries for Agentic Search

上下文与知识检索增强

摘要

最近的多跳推理搜索代理经常因检索不完整的证据或对检索内容的不相关部分进行推理而失败,从而导致检索推理边界转移。我们提出了 R$^2$-Searcher,这是一种新颖的框架,通过细粒度、查询词元引导的证据建模和检索后反思来明确探索和校准检索和推理边界。具体来说,R$^2$-Searcher:(1)通过基于查询标记语义(例如,主题、动作、时间标记和程度修饰符)从检索到的内容中提取精确的事实来构建细粒度的推理上下文,从而引导搜索代理的注意力; (2)引入检索反射机制,在每个检索步骤后评估和纠正边界偏差,指​​导基于提取的推理上下文生成改进的查询; (3) 采用端到端推理反射引导强化学习算法 R$^2$PO,该算法通过基于树的推理区域和反射探索来联合优化两个边界。我们的方法显着提高了检索和推理的质量,建立了检索和推理相互增强的迭代循环。对七个复杂的多跳 QA 基准的大量实验表明,R$^2$-Searcher 在答案准确性和检索推理质量方面显着优于最先进的代理搜索方法。消融研究进一步证实了检索推理边界校准的关键作用。