论文

DeMaVLA:可广义变形操纵的视觉-语言-动作基础模型

DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation

模型训练预训练

摘要

现实世界的家用机器人需要视觉-语言-动作 (VLA) 基础模型,这些模型可以在不同的物体、任务条件和家庭环境中获得可重复使用的操作技能。可变形物体折叠是一项代表性挑战,要求机器人处理不同类别、几何形状、材料和场景的随机初始状态的服装物品。然而,现有的 VLA 系统通常针对不同的对象类别训练单独的策略,而天真的混合多任务训练经常会受到任务干扰和性能下降的影响。为了超越特定类别的折叠策略,我们引入了 DeMaVLA,这是一种用于通用变形操纵的 VLA 基础模型。 DeMaVLA 采用带有动作专家的 VLM 主干,并使用流匹配制定连续动作生成。为了提高效率,动作专家是通过修剪每个其他 Transformer 层来构建的,同时保持与 VLM 主干的逐层对齐,从而减少训练和推理成本。 DeMaVLA 首先经过大约 5,000 小时的选定现实世界双臂演示的预训练,以获得一般操作先验。然后对混合折叠数据进行后训练,通过人机循环数据聚合(DAgger)管道,聚合来自多个折叠任务的真实机器人故障的自我收集的演示和纠正轨迹。实验表明,DeMaVLA 在 RoboTwin 2.0 上实现了具有竞争力的性能,并在我们的家用折叠基准测试中取得了出色的实际结果。这些结果凸显了可扩展的现实世界数据、高效的动作生成以及可变形对象操作中通用 VLA 策略的校正学习的价值。