论文

dVLA-RL:离散扩散视觉-语言-动作模型的去噪轨迹强化学习

dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models

模型训练强化学习

摘要

视觉-语言-动作 (VLA) 模型通过将控制融入 VLM 的语义推理中,为通用机器人操作建立了强大的范例。流行的架构通常通过扩散或流动过程连续地建模动作,或者通过自回归生成或并行解码离散地建模。最近,离散扩散 VLA (dVLA) 作为一种独特的替代方案出现,通过屏蔽生成模型将视觉、语言和动作统一到单个离散标记空间中。在将迭代细化与统一表示相结合的同时,其训练迄今为止仅限于监督 微调 (SFT),而强化学习 (RL) 进一步细化策略的潜力在很大程度上尚未被开发。 dVLA 强化学习的一个基本挑战是 dVLA 生成的最终动作的边际概率仍然难以解决。为了解决这个问题,我们提出 \textbf{dVLA-RL},将学习目标从边际动作概率转移到采样生成路径的联合概率。具体来说,通过将去噪过程建模为马尔可夫决策过程(MDP),我们以数学方式将此路径概率表示为逐步转换的乘积。这个轨迹级目标提供了一个统一的公式,可以自然地适应可变的去噪步骤。利用这种内在的灵活性,我们为复杂的多任务学习引入了统一的步骤调度方法,根据特定的任务复杂性定制去噪步骤,以最大限度地提高成功率和计算效率。广泛的评估表明,我们的方法在 LIBERO 上实现了 \textbf{99.7\%} 的成功率。此外,它通过在 SFT 基线上提供 \textbf{30.6\%} 改进,在 RoboTwin 2.0 上建立了强大的基于 VLA 的结果,保持与强大的世界行动模型基线的竞争力。