论文

MotionVLA:将几何运动注入视觉-语言-动作模型

MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model

摘要

视觉-语言-动作 (VLA) 模型越来越多地根据历史、深度或 4D 特征来调节机器人策略,以解决长视野操作中的模糊性。然而,时空证据越多并不一定越好:当注入的证据与运动不一致时,它可能会引入几何漂移、碎片化的时间线索和不稳定的动作生成。这就提出了一个简单的问题:VLA 应该记住过去的帧,还是记住连接它们的运动?我们引入了 MotionVLA,这是一个运动历史界面,可将简短的过去视频窗口转换为紧凑的、时间连续的轨迹场标记。 MotionVLA 没有将历史视为一组稀疏的独立提升的帧,而是将最近的观察结果表示为物理上连贯的运动证据。当前的视觉标记查询此历史记录以检索与任务相关的运动信息,然后在基于轨迹的监督下将其重新耦合到 VLA 流中。跨模拟基准测试和初步真实机器人展示的实验表明,MotionVLA 改进了长视野操作,同时产生更平滑、更直接的执行。这些结果表明,有效的 VLA 记忆不仅仅在于提供更多 4D 上下文,还在于暴露可用于控制的运动一致证据。