论文

多轮 RAG 何时应停止? Search-R1 中的结构化停止判断和检索减少

When Should Multi-Round RAG Stop? Structured Stopping Judgments and Retrieval Reduction in Search-R1

上下文与知识检索增强

摘要

随着证据的积累,多轮检索增强生成(RAG)必须决定何时停止搜索。由于部署的策略是由每个轨迹上的第一个 STOP 确定的,因此这是一个顺序选择问题,而不是独立的状态分类任务。我们将 S2G-RAG 的结构化充分性和差距判断应用于冻结的 Search-R1 管道,并根据 900 个不相交的 HotpotQA 问题中的 3,009 个状态训练 Qwen3.5-2B 判断。 Search-R1的推理器、检索器、语料库、提示和搜索预算保持不变,而判断检查点和停止阈值是在分组验证上选择的,并在验证性评估之前冻结。在验证性测试集上,相对于 Native Search-R1,生成的策略将检索调用减少了 77 (3.70\%),而官方精确匹配则减少了 0.625 个百分点。因此,训练有素的 S2G 式结构化判断减少了检索,同时广泛保留了答案的准确性。结果并不意味着准确性不变或提高、安全停止或降低总推理成本。