论文
保留未来,放弃预测轨迹:世界动作模型的 RIFT
Keep the Future, Drop the Rollout: RIFT for World Action Models
摘要
世界动作模型(WAM)根据预测的未来来调节机器人的动作,但迭代视频的预测轨迹会增加部署延迟。我们询问行动生成是否需要不断发展的预测轨迹,或者仅需要其未来的表示。在 40 个模拟机器人操作任务的四个 WAM 中,配对闭环干预表明,阻止对未来缓存的访问或重新分配其值会改变执行并降低成功率。然而,在评估的协同去噪设置中,在整个动作去噪过程中重复使用一个固定的最终清理键/值 (K/V) 缓存几乎可以保持未修改的执行,末端执行器平均位移误差为 1.7--1.9$ cm。获得这个缓存仍然需要迭代视频生成。因此,我们提出 RIFT(通过未来词元实现的无需逐步预测的想象),它使用学习到的预期词元在一个骨干通道中构建完整的未来 K/V 缓存。在 LIBERO 上,RIFT 取得了 98.8\%$ 的总体成功,优于所有经过评估的基于预测轨迹的方法,同时产生了 $3.1$--$9.2\times$ 的推理加速。无需进一步训练,它在发行外 LIBERO-Plus 基准测试中取得了 81.1\%$ 的总体成功,比最强的评估基准提高了 +9.7$ 个百分点。在 RoboTwin 上,它在干净场景和随机场景上分别取得了 92.9\%$ 和 92.6\%$ 的成功,是评估方法中最高的。在现实世界的操作任务中,RIFT 的平均成功率为 45.3%\%$,比 Fast-WAM-Joint 提高了 +6.0$ 个百分点。这些结果支持无需逐步生成视频的未来条件化,无需在部署时迭代视频生成。