论文
通过贡献加权组相关策略优化增强基于 LLM 的搜索代理
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
摘要
搜索代理通过允许访问预训练期间不可用的最新长尾信息,将 大语言模型 (LLM) 扩展到静态参数知识之外。虽然强化学习已被广泛用于训练此类代理,但现有方法面临着关键的局限性:过程监督经常受到不稳定的价值估计的影响,而结果监督由于稀疏的轨迹级奖励而难以进行贡献分配。为了弥补这一差距,我们提出了贡献加权GRPO(CW-GRPO),这是一个将流程监督整合到组相对策略优化中的框架。 CW-GRPO 没有直接优化过程奖励,而是采用 LLM 法官来评估每轮搜索的检索效用和推理正确性,产生每轮贡献分数。这些分数用于沿着轨迹重新调整基于结果的优势,从而在不牺牲优化稳定性的情况下实现细粒度的贡献分配。在多个知识密集型基准测试上的实验表明,CW-GRPO 在 Qwen3-8B 上比标准 GRPO 好 5.0%,在 Qwen3-1.7B 上比标准 GRPO 好 6.3%,从而带来更有效的搜索行为。额外的分析表明,成功的轨迹在特定回合中表现出集中的贡献,为搜索代理任务提供了经验见解。