论文

GRPO 的执行轨迹级优势优先体验重放

Rollout-Level Advantage-Prioritized Experience Replay for GRPO

模型训练强化学习

摘要

使用 GRPO 从可验证奖励中进行强化学习是 后训练 推理 LLM 的标准方法。它仍然是低效率的样本。每次执行轨迹都用于单个梯度更新,然后被丢弃。朴素重放不太适合这种设置,因为 LLM 策略每个梯度步骤都会快速漂移。因此,存储的采样轨迹会变得陈旧,并且可能会破坏训练的稳定性。我们为 GRPO 提出了一个 rollout 级重放缓冲区,用于存储和采样单个 rollout,而不是整个组。缓冲区通过年龄驱逐来限制陈旧性。任何早于 tau_max 训练步骤的执行轨迹都会被删除。该缓冲区还通过新鲜锚定组合保留 同策略 数据。每个批次都保留其新鲜的 同策略 执行轨迹,然后连接从缓冲区单独绘制的重播执行轨迹。我们根据每次执行轨迹的优势大小来优先重放,并回收优势较大的单个执行轨迹。在五个数学基准的三个 Qwen3-Base 量表中,我们的方法优于 GRPO 和朴素重播基线。各个规模的收益均为正值,在 4B 的五个基准平均值上达到 +1.66 个百分点。在联合衡量准确性和词元效率的 AES 指标下,我们的方法是唯一在每个规模上都比 GRPO 具有正余量的条件。