论文
DynaWM:用于移动对象操纵的 Base-VLA 引导世界基础模型
DynaWM: A Base-VLA-Guided World Foundation Model for Moving-Object Manipulation
摘要
尽管视觉-语言-动作(VLA)模型受到了广泛的关注,但在操纵动态移动物体方面仍然存在许多挑战。在大多数现有方法中,端到端正向或逆向动态模型(即世界模型)被纳入高性能基础 VLA 架构中,这可能会由于不合适的 微调 而降低经过良好预训练的基础 VLA 模型的性能。在本文中,我们提出了 DynaWM,这是一种基础 VLA 引导的世界基础模型,适用于移动对象操作的各种微调和粗调基础 VLA 检查点。 DynaWM 使用基于 Mamba-3 的动作编码器将基本 VLA 生成的基本动作块编码为动作调节表示,使用 V-JEPA 2.1 视觉编码器从多视图观察历史中提取特征,并使用本体感觉状态编码器对机械臂本体感觉状态进行编码。这些特征表示联合调节流匹配 DiT,以重新生成用于移动对象操纵的运动感知动作轨迹。为了进行系统评估,我们构建了 DynaGrasp-32 基准,涵盖六类运动物体操纵任务,包括速度变化、轨迹变化和多物体操纵,以及 DynaGrasp-1600 数据集,其中包含 32 个场景、1,600 个演示轨迹和大约 153 万张图像。对于微调的基础 VLA 检查点,DynaWM 比 SmolVLA、X-VLA、π0 和 π0.5 分别实现了 7.19、45.31、1.88 和 10.94 的百分比改进。对于粗调的基础 VLA 检查点,性能分别提高了 35.13%、44.06%、35.69% 和 26.13%。消融实验表明,视觉编码可将成功率提高 27.50%,而如果去除动作调节,则成功率会降低 45.44%。