论文
GeniWorld:通过视觉动作进行机器人操作的通用交互式世界模型
GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions
摘要
通用机器人策略表现出强大的能力,但它们在复杂和看不见的环境中的鲁棒性仍然有限。在不同的现实环境中扩展机器人学习和评估仍然成本高昂且具有挑战性。行动条件世界模型提供了一种有前途的替代方案,但它们经常受到行动可控性有限和对分布外(OOD)场景的泛化能力较差的困扰。为此,我们提出了 GeniWorld,这是一种机器人交互式世界模型,可以在未见过的场景中稳健地泛化。在预训练的视频生成模型的基础上,我们使用基于 URDF 的渲染将数字动作转换为视觉动作表示,从而实现基于空间的动作控制。通过明确地将实施例运动学与环境动力学解耦,我们的模型减轻了场景过度拟合并促进了机器人与环境交互的建模。为了实现闭环控制,我们构建了一个与高频机器人运动学控制集成的自回归视频预测模型,从而实现与机器人策略和人类远程操作员的交互。在我们的实验中,即使仅在有限的固定场景数据上进行训练,我们的模型也能实现卓越的域内性能和对高度随机、看不见的环境的稳健的零样本泛化。对于下游应用程序,GeniWorld 充当可扩展的策略评估器,在环境扰动下仍然可靠。此外,即使现实世界的演示有限,GeniWorld 也会在世界模型中生成不同的操纵轨迹,从而提高下游政策的绩效和复杂环境中的鲁棒性。