论文
通过在训练期间回收零方差查询来有效强化学习用于代理搜索
Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During Training
摘要
GRPO 式算法的使用已成为在仅结果奖励下训练 LLM 搜索代理的标准策略。使用这些算法,只有当查询的采样轨迹组混合成功和失败时,查询才会对参数更新做出贡献;所有正确(太简单)和所有不正确(太难)组都是零方差和浪费采样轨迹成本。现有方法将零方差视为静态属性,并丢弃或预过滤此类组。我们假设并凭经验验证,随着训练过程中策略的发展,查询会在零方差和信号承载状态之间翻转。基于这种直觉,我们提出查询回收,它将零方差组返回到可变池以供将来重采样,以便有效的训练分布与策略共同发展。利用所提出的技术,在合成数据上训练的 1.7B 参数模型可以在七个多跳 QA 基准上达到 66.0 平均 Pass@1,匹配或超越在基准衍生监督上训练的多达 7B 参数的系统。对回收模式的分析表明,到训练结束时,回收的查询大约提供了有效批次的四分之三,其贡献分为策略改进和策略漂移的恢复。