论文

以扩散并行与训练器辅助生成加速视觉生成式LLM的分离式RL

Accelerating Disaggregated RL for Visual Generative LLMs with Diffusion-Based Parallelism and Trainer-Assisted Generation

AI 基础设施AI 开发与运维平台

摘要

强化学习(RL)已成为主流后训练范式——催生了veRL等面向自回归大语言模型(LLM)的高性能RL系统。与此同时——面向扩散的RL算法(如DanceGRPO与FlowGRPO)迅速把RL范围从语言推理扩展到扩散视觉与流生成。但面向扩散生成式LLM的高效RL系统仍少被探索。既有实现(如veRL-Omni)仍依赖同置执行——简化同步但耦合rollout与训练资源——限制异构部署并约束独立扩展。为此——我们介绍DigenRL——面向扩散生成式LLM的分离式RL框架——支持灵活资源分配、容纳异构GPU并促成高效任务调度。为最大限度减少分离架构中的执行气泡——我们提出:1) 扩散架构中的生成轴流水线(GAP)与时间步并行(TSP)——实现rollout与训练间更细粒度流水;2) 弹性训练器辅助生成(TAG)——让训练器GPU资源动态协助执行rollout生成;3) 紧一步约束的异步策略——进一步利用管线尾部气泡。在使用HunyuanVideo-13B、Wan2.1-14B、FLUX.1-12B与QwenImage-20B生成模型、16-32 GPU的三个硬件测试台上开展大量实验。结果表明DigenRL较SOTA扩散RL系统veRL-Omni与GenRL取得1.56-2.10倍吞吐提升。

以扩散并行与训练器辅助生成加速视觉生成式LLM的分离式RL:论文配图
图 1. 四种执行模式的比较。我们在图中省略了奖励阶段,因为它只占总时间的一小部分。 (a) 并置执行:所有计算资源一次分配到一个阶段,工作人员共享模型状态和数据。 (b) 简单的分解执行:资源被划分为两组(生成器和训练器),这两个组之间存在很强的阶段间依赖关系。 (c) 微批次流水线的分解执行:一批数据被分割为多个微批次,使生成器和训练器能够以流水线方式执行。 (d) 我们提出的训练器辅助生成(TAG):可以通过允许闲置训练器资源参与生成来减少管道泡沫。四面板时间线比较了协同定位执行、朴素分解、微批量流水线和 TAG,突出了每种设计如何改变生成器和训练器空闲时间。