论文

MotionWeave:学习以运动为中心的未来动态,以实现视觉-语言-行动策略

MotionWeave: Learning Motion-Centered Future Dynamics for Vision-Language-Action Policies

模型训练监督微调与指令调优

摘要

视觉-语言-动作(VLA)模型最近整合了世界模型,以提供超越稀疏动作标签的更丰富的动态监督。然而,明确预测未来图像或视频可能包括与控制无关的外观,而从整体未来视觉表示和共享全局动作特征导出的指导可能无法在动作和局部视觉变化之间建立特定于时间步长的对应关系。为了解决这个问题,我们提出了 MotionWeave,一个以运动为中心的未来动态框架,用于动作块预测,具有两个模块:动作诱导运动地面器(AIMG)和地平线残留作曲家(HRC)。具体来说,AIMG 以动作和本体感受表征为条件,构建特定于视野的查询,定位与当前视觉词元中每个未来动作时间步相关的交互区域。 HRC 提取相邻视野处交互表示之间的差异,将它们编码为时间运动线索,并通过门控残差将它们注入到动作标记中。在训练过程中,从未来帧渲染的机器人手臂掩模用于构建基于 KL 的运动grounding监督,而推理仅使用当前的观察结果。在六项 MetaWorld 任务中,MotionWeave 取得了 75.3% 的平均成功率,比 π0 (66.7%) 绝对提高了 8.6%,特别是在持续交互任务上。我们的代码可在 https://github.com/autu-mn/MotionWeave. 获取