论文
D-VLA:面向视觉-语言-动作模型的高并发分布式异步强化学习框架
D-VLA: A High-Concurrency Distributed Asynchronous Reinforcement Learning Framework for Vision-Language-Action Models
摘要
具身智能的快速演进使视觉-语言-动作(Vision-Language-Action,VLA)模型在多模态感知和任务执行方面表现卓越。然而,将强化学习(RL)应用于大规模分布式环境中的这些巨型模型面临严重的系统性瓶颈,主要源于高保真物理仿真与深度学习高强度的显存/带宽需求之间的资源冲突。这种冲突常常使整体吞吐量受制于执行阶段的低效。为应对这些挑战,我们提出D-VLA,一个面向大规模具身基础模型的高并发、低延迟分布式RL框架。D-VLA引入“平面解耦”(Plane Decoupling),将高频训练数据与低频权重控制物理隔离,以消除仿真与优化之间的相互干扰。我们进一步设计了四线程异步“泳道”(Swimlane)流水线,使采样、推理、梯度计算和参数分发完全并行重叠。此外,双池显存管理模型和拓扑感知复制解决了内存碎片问题并优化通信效率。在LIBERO等基准上的实验表明,对于十亿参数级VLA模型,D-VLA在吞吐量和采样效率上显著优于主流RL框架。在万亿参数可扩展性测试中,我们的框架保持了出色的稳定性和线性加速,为高性能通用具身智能体提供了鲁棒的系统。
