论文
陈旧性在哪里累积? LLM 训练后异步 RL 的池感知有效过时控制
Where Does Staleness Accumulate? Pool Aware Effective Staleness Control for Asynchronous RL in LLM Post-Training
摘要
全异步强化学习 (RL) 通过将部署生成与策略优化重叠,提高了大语言模型训练后的资源利用率,但它也引入了策略滞后,因为在训练器持续更新时生成轨迹并排队。我们研究这种滞后如何在轨迹的生命周期内累积,以及如何在不牺牲异步执行的挂钟优势的情况下控制它。我们将轨迹陈旧性分解为在rollout完成之前累积的生成陈旧性和在完成的轨迹进入池后累积的等待陈旧性。受这种分解的推动,我们引入了 PACE(有效失效的池感知控制)。 PACE 将超额池占用率转换为自适应拒绝预算,并使用有效陈旧度分数对已完成的轨迹进行排名,该有效陈旧度分数将等待陈旧度与前缀感知的生成陈旧度相结合。这可以避免仅仅因为跨越多个策略版本而对长时间或中断的部署进行惩罚。在单轮数学推理中,在相同的挂钟预算下,PACE 的六基准平均验证精度比未过滤的异步 RL 提高了 18.7%,并且与同步 RL 性能相匹配,GPU 时间减少了 47.1%。 PACE 还提高了多轮工具集成推理的验证性能,优于同步和未过滤的异步 RL。对混合专家模型和替代强化学习算法的进一步实验支持其跨模型架构和训练算法的适用性。