论文
通过机器人渲染构建机器人因素的世界模型
Robot-Factored World Models via Robot Rendering
摘要
动作条件视频世界模型根据初始观察和动作信号预测未来的观察。在机器人技术中,动作通过两个不同的过程影响未来的观察:它们首先由机器人主体和控制器实现为机器人运动,然后场景通过接触和物体运动做出响应。直接根据动作命令进行调节要求世界模型学习实现过程本身,而根据记录的未来状态进行调节会泄露其旨在预测的交互结果。我们提出了机器人因素的世界模型,它将两个机器人特定的因素移到了世界模型之外。首先,动作实现:每个命令都通过机器人自己的控制器和运动学滚动到可部署的标称轨迹中,这是一个避免动作实现学习和未来状态泄漏的中间信号。其次,机器人渲染:这个标称轨迹是通过机器人 URDF 渲染的,将机器人的几何形状、运动学和外观从模型中分解出来,并转化为显式渲染的机器人几何形状。为了解决深度模糊问题,我们将末端执行器深度与场景深度配对,为超出图像平面重叠的接触和遮挡提供几何线索。相机感知的静态 RGB/深度上下文和渲染的机器人几何体共同形成了一个共享的视觉世界模型界面,该界面在视点和机器人实施例之间保持一致,因此模型仅将动作视为可见的机器人几何体,并学习对象如何响应它。我们的实验表明,渲染的界面优于矢量条件基线,并在推理时推广到看不见的机器人实施例。我们进一步证明,我们的模型通过将手部运动重新定位和渲染为机器人几何形状,从人类演示中生成机器人操作视频。