论文
以扩散并行与训练器辅助生成加速视觉生成式LLM的分离式RL
Accelerating Disaggregated RL for Visual Generative LLMs with Diffusion-Based Parallelism and Trainer-Assisted Generation
摘要
强化学习(RL)已成为主流后训练范式——催生了veRL等面向自回归大语言模型(LLM)的高性能RL系统。与此同时——面向扩散的RL算法(如DanceGRPO与FlowGRPO)迅速把RL范围从语言推理扩展到扩散视觉与流生成。但面向扩散生成式LLM的高效RL系统仍少被探索。既有实现(如veRL-Omni)仍依赖同置执行——简化同步但耦合rollout与训练资源——限制异构部署并约束独立扩展。为此——我们介绍DigenRL——面向扩散生成式LLM的分离式RL框架——支持灵活资源分配、容纳异构GPU并促成高效任务调度。为最大限度减少分离架构中的执行气泡——我们提出:1) 扩散架构中的生成轴流水线(GAP)与时间步并行(TSP)——实现rollout与训练间更细粒度流水;2) 弹性训练器辅助生成(TAG)——让训练器GPU资源动态协助执行rollout生成;3) 紧一步约束的异步策略——进一步利用管线尾部气泡。在使用HunyuanVideo-13B、Wan2.1-14B、FLUX.1-12B与QwenImage-20B生成模型、16-32 GPU的三个硬件测试台上开展大量实验。结果表明DigenRL较SOTA扩散RL系统veRL-Omni与GenRL取得1.56-2.10倍吞吐提升。
