论文

通过几何潜在扩散的空间感知世界行动模型

Spatially Aware World Action Model via Geometric Latent Diffusion

模型训练监督微调与指令调优

摘要

世界行动模型 (WAM) 利用大规模预训练视频传播模型的功能来联合预测未来的观察和行动,继承互联网规模视频的丰富视觉和物理先验。这使它们成为机器人策略学习的有前途的范例,但流行的模型仅在 RGB 观察上运行,并且不利用 3D 信息。为了弥补这一差距,我们引入了空间感知世界动作模型 (SA-WAM),它将预训练视频模型重新用于联合动作、RGB 和深度预测,从而在单个扩散主干中实现 3D 感知世界建模和动作预测。我们使用非线性编码将无界深度信号映射到冻结 VAE 标记器期望的有界输入域。这使我们能够在没有 3D 特定 微调 的情况下重用分词器,在不牺牲预训练先验的情况下合并几何信息。 SA-WAM 在 RoboCasa 和 LIBERO-Plus 基准上取得了最先进的结果,同时改进了未来状态预测。此外,SA-WAM 在使用 UR5 机械臂的现实世界评估中表现优于强大的基线,在随机环境中取得了巨大的进步。我们分析世界模型预测质量与部署成功之间的相关性,提供有关 WAM 性能及其改进途径的见解。