论文

ProgressVLA:视觉语言机器人操作的进步引导扩散策略

ProgressVLA: Progress-Guided Diffusion Policy for Vision-Language Robotic Manipulation

摘要

大多数现有的机器人操作视觉-语言-动作(VLA)模型缺乏进度意识,通常依赖于手工设计的启发式方法来终止任务。这种限制在涉及级联子目标的长期任务中尤其严重。在这项工作中,我们研究了任务进度的估计和整合,提出了一种名为 {\textbf \vla} 的新颖模型。我们的技术贡献有两个:(1)\emph{鲁棒进度估计}:我们在大规模、无监督的视频文本机器人数据集上预训练进度估计器。该估计器在模拟中实现了低预测残差(在 $[0, 1]$ 范围内为 0.07),并演示了对未见过的现实世界样本的零样本泛化,以及(2)\emph{可微分进度指导}:我们引入了一种逆动态世界模型,该模型将预测的动作标记映射到未来的潜在视觉状态。然后,这些潜在变量由进度估计器进行处理;通过应用最大进度正则化,我们建立了一个可微分的管道,提供以进度为导向的指导来细化操作标记。对 CALVIN 和 LIBERO 基准进行的大量实验以及现实世界的机器人部署,一致证明了成功率和泛化能力比强基准有显着提高。