论文
CAPF:经信用衰减特权反馈引导搜索智能体rollout
CAPF: Guiding Search-Agent Rollouts with Credit-Attenuated Privileged Feedback
摘要
最近的大语言模型搜索代理使用具有可验证奖励的强化学习(RLVR)来从结果奖励中学习搜索增强推理。在困难问题上,这些代理很少进行端到端的成功部署,使得只注重结果的 RLVR 几乎没有积极的奖励轨迹。我们认为,改进对此类问题的学习需要在训练期间提供额外的指导,并且 RLVR 已经包含可以提供该指导的验证方信息。此信息可以识别代理提交的答案中的错误或遗漏,并指导部署过程中的修订。我们提出了一种名为 \textbf{Credit-Attenuated Privileged Feedback} (CAPF) 的训练时机制,该机制使验证者端信息可以在训练期间通过特权反馈调用获得。 CAPF 允许策略将零奖励尝试修改为正奖励修复轨迹,并削弱反馈电话和早期行动的信用,以适应没有此电话的部署。实证研究表明,CAPF 将 Qwen3-4B 的平均精确匹配分数从仅结果 RLVR 下的 44.7% 提高到七个开放域 QA 基准上的 48.5%。
