论文

WEAVER,更好、更快、更长:机器人操作的有效世界模型

WEAVER, Better, Faster, Longer: An Effective World Model for Robotic Manipulation

模型架构新型架构

摘要

世界模型(WM,即学习模拟器)对机器人技术的潜在影响是深远的——政策评估、政策改进和测试时间规划——所有这些都与有限的现实世界交互有关。为了解锁这些下游功能,WM需要共同满足三个需求:$\textit{(i)}$保真度(即生成与现实相关的模拟轨迹)、$\textit{(ii)}$一致性(即生成长期一致的模拟轨迹)和$\textit{(iii)}$效率(即快速生成模拟轨迹)。我们提出了 WEAVER(针对具体推理的跨视图世界估计):一种 WM 架构,可以同时实现所有三个愿望,为机器人操作任务提供最先进的结果。 WEAVER 是一种多视图 WM,经过训练可以通过流量匹配损失来预测未来的潜伏和奖励值。我们提炼了跨模型架构、内存和预测目标的关键设计决策,以解锁各种长期动态操作任务,这些任务混淆了先前的世界建模方法。我们将 WEAVER 应用到机器人硬件中,证明了其在策略评估($ρ$=0.870 与现实世界成功率的相关性)、策略改进(在 $π_{0.5}$ 机器人基础模型之上,实际成功率提高了 $38\%$)和测试时规划(实际成功率提高了 $14\%$,与之前的 WM 相比提高了 $5-10\times$)方面的有效性。在对分发外场景进行评估时,WEAVER 还表现出了比以前的 WM 更好的性能。代码、模型和视频位于:https://arnavkj1995.github.io/WEAVER/。