论文
DyPES-VLA:学习共享动态先验和跨实施例操作的特定实施例控制
DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation
摘要
视觉-语言-动作(VLA)模型已成为机器人操纵的强大范例,但为异构机器人实施例训练单一通才策略仍然是一个悬而未决的问题。现有方法有两个主要局限性。首先,他们没有充分利用跨不同视觉和交互数据共享的动态先验,限制了跨实体传输。其次,它们需要大量的手动预处理来将特定于实施例的动作转换为通用格式。为了克服这些限制,我们提出了 DyPES-VLA,这是一种跨实施例 VLA,可以学习共享的动态先验和特定于实施例的控制。首先,我们通过在跨实施例数据上训练具有未来预测目标的视觉语言模型(VLM)来学习共享动态先验,驱动共享查询表示来捕获对象运动、接触和交互引起的场景变化。其次,特定于实施例的专家混合(MoE)动作头将这些共享的动态先验直接转换成每个实施例的本机动作空间中的可执行控制,而无需手动将异构动作预先对齐为通用格式。该头共享注意力层以捕获常见的时间动作结构,而其特定于实施例的前馈专家解决了不同实施例的独特运动学约束和控制语义。作为一项通用政策,我们的方法在模拟和现实世界评估中实现了最先进的性能,在 LIBERO 上达到 98.0% 的成功率,在 RoboCasa-GR1 上达到 59.25% 的成功率,在 RoboTwin~2.0 上达到 89.02% 的成功率。