论文

Libra:Agentic RL 的高效资源管理 后训练

Libra: Efficient Resource Management for Agentic RL Post-Training

AI 基础设施模型训练强化学习分布式训练基础设施Agentic RL

摘要

强化学习 (RL) 已成为标准 后训练 范式,用于将 大语言模型 (LLM) 塑造为有能力的智能体。在代理强化学习中,执行轨迹阶段会在调用工具的同时生成轨迹,从而产生长尾和非平稳的工作负载,从而暴露出两个基本挑战。首先,由于长尾响应分布,一小部分轨迹主导了执行轨迹时间。其次,执行轨迹和训练在计算模式、内存需求和对序列长度的敏感性方面有所不同。随着政策的发展,工作负载分配的变化进一步改变了它们的相对资源需求,使得两个阶段很难保持平衡的执行。我们执行轨迹了 Libra,一种用于代理 RL 后训练 的自适应运行时,具有两个互补组件:(1) 通过因果关系引导桶调度程序进行阶段内调度,该调度程序在具有不同并行配置的执行桶之间路由请求,从而减少执行轨迹落后者的延迟; (2) 跨阶段协调,随着工作量的变化,在采样和训练之间动态地重新分配工作人员。它通过非阻塞协议在两个阶段之间移动工作人员,而不会中断正在进行的训练。在 48 倍 NVIDIA A800 GPU 集群和 160 倍 Ascend 910B3 NPU 集群的三个代理基准测试中进行评估,Libra 的吞吐量提高了 4.2 倍,奖励收敛速度提高了 2.7 倍