论文
余量漂移重放:GRPO 中原则性重放控制的原语
Headroom-Drift Replay: A Primitive for Principled Replay Control in GRPO
摘要
基于强化学习的 后训练 推理模型越来越受到重复的新采样轨迹生成的瓶颈,特别是在环境交互主导挂钟成本的代理环境中。重放可以通过重用过去的轨迹来减轻这种负担,但现有的方法通常将其嵌入到涉及探索、经验重组或混合策略优化的更大的训练管道中。这使得重放自身的贡献很难被隔离。我们提出一个重点问题:有原则的重播选择能走多远?我们引入了 Headroom-Drift Replay,这是 GRPO 的组级重放控制原语,它将重用分为两个决策。 Headroom 根据剩余学习价值对存储的组进行排名,而 Drift 通过与当前策略的兼容性对它们进行门控。新的同策略流保持不变,并且该方法不添加辅助生成或训练机制。在数学推理、多模态推理和代理搜索基准测试中,这种单一干预的表现优于朴素重放,并且在 Avg Mean@32 上匹配或超过更广泛的重放方法。在代理搜索中,环境交互在成本中占主导地位,它可以在显着缩短挂钟时间的情况下提供相当的质量。