论文

RL-VLA$^3$:强化学习 VLA 通过完全异步加速

RL-VLA$^3$: Reinforcement Learning VLA Accelerating via Full Asynchronism

AI 基础设施AI 开发与运维平台

摘要

近年来,视觉-语言-动作(VLA)模型已成为通向通用体现智能的重要途径,但其训练效率已成为关键瓶颈。尽管现有的基于强化学习(RL)的训练框架(例如RLinf)可以增强模型泛化能力,但它们仍然依赖于同步执行,导致环境交互、策略生成(推出)和模型更新阶段(参与者)期间严重的资源利用不足和吞吐量限制。为了克服这一挑战,本文首次提出并实现了一个完全异步的策略训练框架,涵盖从环境交互、推出生成到参与者策略更新的整个流程。我们的框架系统地从大型模型强化学习中的异步优化思想中汲取灵感,设计了多级解耦架构。这包括环境交互和轨迹收集的异步并行化、策略生成的流式执行以及训练更新的解耦调度。我们在不同的 VLA 模型和环境中验证了我们的方法的有效性。在 LIBERO 基准测试中,与现有同步策略相比,该框架的吞吐量提高了高达 59.25%。当深度优化分离策略时,通量可提升高达126.67\%。我们通过消融研究验证了每个异步组件的有效性。跨 8 到 256 个 GPU 的扩展定律验证证明了我们的方法在大多数条件下具有出色的可扩展性。

RL-VLA³:面向VLA训练的灵活异步强化学习框架
图1:所提出的用于VLA训练的异步框架示意。该设计在两个层次上异步运行:(1) 宏观上,在rollout与训练流水线阶段之间;(2) 微观上,在每个rollout周期内。后者由两种触发策略控制:批大小和等待时间。