论文

CAPF:经信用衰减特权反馈引导搜索智能体rollout

CAPF: Guiding Search-Agent Rollouts with Credit-Attenuated Privileged Feedback

模型训练强化学习RLVRAgentic RL

摘要

最近的大语言模型搜索代理使用具有可验证奖励的强化学习(RLVR)来从结果奖励中学习搜索增强推理。在困难问题上,这些代理很少进行端到端的成功部署,使得只注重结果的 RLVR 几乎没有积极的奖励轨迹。我们认为,改进对此类问题的学习需要在训练期间提供额外的指导,并且 RLVR 已经包含可以提供该指导的验证方信息。此信息可以识别代理提交的答案中的错误或遗漏,并指导部署过程中的修订。我们提出了一种名为 \textbf{Credit-Attenuated Privileged Feedback} (CAPF) 的训练时机制,该机制使验证者端信息可以在训练期间通过特权反馈调用获得。 CAPF 允许策略将零奖励尝试修改为正奖励修复轨迹,并削弱反馈电话和早期行动的信用,以适应没有此电话的部署。实证研究表明,CAPF 将 Qwen3-4B 的平均精确匹配分数从仅结果 RLVR 下的 44.7% 提高到七个开放域 QA 基准上的 48.5%。

CAPF:经信用衰减特权反馈引导搜索智能体rollout:论文配图
图 1:代理在训练期间使用特权反馈来修复不确定的候选答案。考虑到“哪个国家主办了 2014 年冬季奥运会?”这个问题,代理首先起草“索契”,但仍不确定,并调用“特权反馈”。反馈表明“索契”是主办城市,而不是请求的国家。然后,代理将最终答案修改为“俄罗斯”。