论文

D-VLA:面向视觉-语言-动作模型的高并发分布式异步强化学习框架

D-VLA: A High-Concurrency Distributed Asynchronous Reinforcement Learning Framework for Vision-Language-Action Models

AI 基础设施模型训练强化学习AI 开发与运维平台

摘要

具身智能的快速演进使视觉-语言-动作(Vision-Language-Action,VLA)模型在多模态感知和任务执行方面表现卓越。然而,将强化学习(RL)应用于大规模分布式环境中的这些巨型模型面临严重的系统性瓶颈,主要源于高保真物理仿真与深度学习高强度的显存/带宽需求之间的资源冲突。这种冲突常常使整体吞吐量受制于执行阶段的低效。为应对这些挑战,我们提出D-VLA,一个面向大规模具身基础模型的高并发、低延迟分布式RL框架。D-VLA引入“平面解耦”(Plane Decoupling),将高频训练数据与低频权重控制物理隔离,以消除仿真与优化之间的相互干扰。我们进一步设计了四线程异步“泳道”(Swimlane)流水线,使采样、推理、梯度计算和参数分发完全并行重叠。此外,双池显存管理模型和拓扑感知复制解决了内存碎片问题并优化通信效率。在LIBERO等基准上的实验表明,对于十亿参数级VLA模型,D-VLA在吞吐量和采样效率上显著优于主流RL框架。在万亿参数可扩展性测试中,我们的框架保持了出色的稳定性和线性加速,为高性能通用具身智能体提供了鲁棒的系统。

D-VLA:面向视觉-语言-动作模型的高并发分布式异步强化学习框架:论文配图
图 2:D-VLA 框架:异步嵌入 RL 训练架构 D-VLA 概述。 GPU 池分为 rollout 工作线程和 Actor 工作线程。 Rollout GPU 将 PhysX 加速的并行环境与冻结的推理策略副本并置,消除了进程间观察传输和模型卸载开销。完成固定范围推出周期后,轨迹数据通过 NCCL all-to-all 分派到 actor GPU,其中 GRPO 优势和剪切策略梯度在 FSDP 下计算。更新后的权重通过后台 Gloo 通道广播回来——故意与 CUDA 分离,以避免与 PhysX 发生流争用。该管道通过单步权重过时的同步交替实现了近 2 倍的吞吐量。