论文

DriftingVLA:通过每维时间漂移生成本机一步视觉-语言-动作

DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting

模型推理推理加速

摘要

传统的基于流的视觉语言动作(VLA)模型支持富有表现力的连续动作生成,但依赖于多步细化来生成每个动作块,从而增加了在线机器人控制的延迟。为了解决这个问题,我们引入了 DriftingVLA,这是一种本机单步 VLA,它通过单个动作专家前向传递生成完整的动作块。 DriftingVLA 不是学习需要在推理时进行迭代集成的流场,而是使用分布漂移目标来学习直接的噪声到动作块映射以进行一步部署。由于机器人动作维度具有不同的控制语义和分布特征,因此我们进一步引入了每维度时间漂移(PDTD)。 PDTD 将每个动作维度的完整时间轨迹视为单独的漂移单元,从而能够对特定维度的动作分布进行更细粒度的建模和塑造。这种按维度分解仅适用于训练目标;共享VLA模型仍然联合生成完整的动作块,从而保留跨维度依赖性。 DriftingVLA 在 LIBERO 上取得了 98.32% 的成功率,在 RoboTwin 2.0 上取得了 81.09% 的成功率,在六个现实世界的单臂和双臂任务中取得了 77.67% 的成功率,优于评估的多步流策略和单步 VLA 基线。本机一步部署还使动作块生成速度提高了 3.36 倍,消除了迭代细化而不牺牲控制性能。