论文

选择性采样轨迹:多样本代理 RL 的中轨迹终止

Selective Rollout: Mid-Trajectory Termination for Multi-Sample Agent RL

模型训练强化学习

摘要

组相关 RL 训练 (GRPO) 针对每个训练提示对一小组并行采样轨迹进行采样,并使用其组内奖励分布来计算每个轨迹的优势。在代理环境中,每次部署都是一次长时间的多轮对话,每步调用一次 LLM,因此这种多样本乘数在总训练成本中占主导地位。当每次提示的采样轨迹都以相同的奖励结束时,该组的奖励方差为零并且不贡献梯度,因此额外的采样轨迹不会添加任何信息;此类组在实践中很常见(通常占所有组的 40% 左右),因此浪费计算的比例相当大,而不是微不足道。现有方法在提示级别过滤此类组,无论是在付费采样轨迹之后还是在任何采样轨迹开始之前,但这两种方法都在不使用采样轨迹期间可用的信息的情况下进行决定。相反,我们询问中间步骤中部分轨迹之间的组内分歧是否已经可以预测该组将是零方差:当并行采样轨迹已经收敛于相同的动作前缀时,该组有望产生单个奖励,我们可以提前停止。我们提出了一种单参数门,当部分动作序列之间的平均成对前缀编辑距离低于阈值时,该门会停止一个组。在使用 Qwen2.5-7B 在 ALFWorld 上运行的 60 次迭代 同策略 GRPO 上,对四个随机种子进行平均,门控臂的挂钟完成速度提高了 10.7%(引导程序 95% CI 排除 0),并将 50 个未见任务的保留成功率改变了 +2.5 pp,保留增益跟踪到零优势的可测量减少梯度批量稀释。代码可在 https://github.com/zhiyuanZhai20/selective-rollout 获取。