论文

EBRL:通过多粒度资源管理的异步体现强化学习

EBRL: Asynchronous Embodied RL by Multi-Grained Resource Management

AI 基础设施分布式训练基础设施

摘要

具身强化学习 (RL) 通过环境模拟、动作生成和模型更新的流程来提高模型功能。这些阶段表现出异构的CPU和GPU需求,使得高效的资源利用变得困难。最近的系统将部署(模拟和生成)与效率训练重叠,但部署中的专有 GPU 分配和同步障碍仍然造成大量硬件资源浪费。在本文中,我们提出了 EBRL,这是一种具有两项核心技术的异步具体强化学习训练系统。异步流水线调度程序重叠部署和训练、跨环境组的流水线模拟和生成,并独立执行每个环境,从而消除同步停顿。细粒度资源管理器池化 CPU 核心和 GPU 流多处理器,并使用阶段配置文件和运行时反馈来调整资源配额和批量大小,以满足阶段之间的变化需求。我们在 RLinf 上实现 EBRL,并在异构 GPU 测试台上使用四个具体策略和四个模拟基准对其进行评估。实验表明,与 SOTA 体现的 RL 系统相比,EBRL 实现了 1.30-3.47 倍的端到端轨迹采样吞吐量和 2.5 倍的训练收敛性。