论文

PEARL:Agentic 强化学习的弹性自适应预填充解码执行

PEARL: Adaptive Prefill-Decode Execution with Elasticity for Agentic Reinforcement Learning

AI 基础设施模型训练强化学习分布式训练基础设施Agentic RL

摘要

多轮部署在 agentic 强化学习 (RL) 的成本中占主导地位。异步执行和弹性 GPU 资源可以加速此阶段,但添加部署副本会产生收益递减,同时训练 GPU 在更新之间保持空闲状态。我们观察到,有效的资源使用还取决于预填充-解码(PD)配置。共置和分解之间的选择以及最佳 PD 比率都随工作负载而变化,使得资源扩展和 PD 配置相互依赖。利用这一机会需要选择有效的配置,并在短暂的资源可用性窗口内实现其优势,尽管需要重新配置成本。我们rollout了 PEARL,这是一种异步 agentic RL 系统,它可以协调外部资源弹性、空闲训练 GPU 的临时重用以及自适应 PD 执行。 PEARL 维护统一的 GPU-工作者-角色状态,并使用运行时配置文件来预测转出批量完成时间,从而解决环境引起的解码并发性减少的问题。它在当前 GPU 预算下选择 PD 模式和比率,并将每个决策转化为增量过渡计划,最大限度地减少工作人员和角色的变化。具有成本意识的转换和借用策略可以抑制预期收益不足的转换,同时确保及时返回训练 GPU。我们的评估表明,PEARL 在不同的 LLM 中实现了固定资源 ROLL 吞吐量的 $2.17$--$2.79\times$。与 RLBoost+ 相比,Qwen3-8B 的吞吐量提高了约 26.9%,Qwen3-30B-A3B 的吞吐量提高了 36.3%。