论文

EviBack:基于证据约束教师回退的搜索智能体强化学习

EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff

模型训练强化学习RLVRAgentic RL

摘要

强化学习使Agentic RAG(智能体检索增强生成)系统能够从可验证的结果奖励中学习多轮搜索,但全零rollout组无法提供比较信号,还可能埋没有用的搜索行为。我们提出EviBack,一种证据约束的教师回退机制,在保留可验证Actor奖励的同时为此类组提供辅助监督。它将证据评估与答案精炼分离,防止参考答案覆盖证据不足的判断。一条全自动化、端到端、由GPT-5.5辅助的APE流水线,从人工编写的单提示双任务教师出发,自动划分并标注rollout数据,并执行消融、任务分解、评估与选择,最终产出带门控的两阶段教师。与人工设计相比,所得教师提升了下游F1与有效答案率,同时减少了搜索量、重复查询和强制终止。在七个开放域QA基准和三个Qwen3规模上,EviBack的F1优于Search-R1,并提升了单跳与多跳的宏平均F1。我们保证代码将在后续阶段公开发布。

EviBack:基于证据约束教师回退的搜索智能体强化学习:论文配图
图 1:EviBack 训练和无教师推理。经过验证的演员结果绕过了老师;全零组使用证据约束的退避。 GPT-5.5通过E2E-APE构建并冻结Teacher。