论文
拦截未来:动态 VLA 操作的潜在空间预测世界模型
Intercepting the Future: Latent-Space Predictive World Model for Dynamic VLA Manipulation
摘要
视觉-语言-动作 (VLA) 模型可以泛化静态操作,但当对象在任务执行期间移动时会失败。他们将当前观察映射到一个动作,并假设场景在观察和执行之间是静止的,因此在任何不平凡的对象速度下,产生的延迟都会超过可掌握的时间。我们通过 AHEAD(自适应动态的预期地平线外推)缩小了这一差距,这是一种先预测后行动的包装器,它通过运动感知的潜在世界模型增强了冻结的 VLA。一个经过操纵视频训练的小世界模型可以预测 VLA 特征空间中的未来补丁标记,以每个标记的速度和光流加速度为条件。语言和运动显着性掩模将预测集中在与任务相关的补丁上,模型在自适应范围内向前滚动,当预测不确定性超过阈值时停止。然后,冻结动作解码器接收预测的未来词元来代替当前词元。 AHEAD 向冻结的 7B OpenVLA 添加了 490 万个参数,并在 20 个动态模拟场景中达到了 79% 到 97% 的成功率,其中最强基线达到了 31% 到 58%。在物理 UFactory xArm 7 上,AHEAD 在三个传送带和滚球任务上取得了 29/30 到 30/30 的成功,在桨拦截上取得了 23/30 的成功,在射弹捕捉上取得了 19/30 的成功,其中每个基线得分为 0/30。