论文
$τ_0$-WM:用于机器人操作的统一视频动作世界模型
$τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation
摘要
机器人操作需要模型能够生成可执行的动作,同时在物理执行之前预测和评估其未来的后果。我们提出了$τ_0$-世界模型($τ_0$-WM),这是一个统一的视频动作世界模型,它将政策学习、视频预测和动作评估集成在一个未来预测框架内。 $τ_0$-WM 建立在共享视频传播主干之上,提供两个互补的接口。首先,视频动作模型根据多视图观察、语言指令和机器人状态联合预测未来的视觉潜伏和连续动作块。其次,动作条件视频模拟器将候选动作块轨迹采样到多视图未来中,并预测密集的任务进度分数。该模型接受了大约 27,300 小时的真实机器人远程操作、UMI 式交互、以自我为中心的人类视频以及使用特定模态监督掩码的轨迹采样或失败轨迹的训练。在推理时,$τ_0$-WM 使用测试时计算对候选动作进行采样,通过重新去噪一致性对它们进行排名,并对低质量候选调用基于模拟器的校正。在具有挑战性的长视野和细粒度机器人操作任务中,$τ_0$-WM 显示出优于其他相关基线的性能。