论文
RynnWorld-4D:机器人操作的 4D 体现世界模型
RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
摘要
开放世界中的机器人操纵不仅需要识别场景的外观,还需要预测其 3D 结构在交互下如何移动。我们认为同步 RGB、深度和光流 (RGB-DF) 提供了一种物理基础的表示,可以捕获场景的底层 4D 动态。与 2D 像素视频相比,这种多模态协同作用将视觉外观与几何结构和时间运动结合起来,创建一个明显更接近机器人系统所需的底层末端执行器动作的表示空间,缩小世界预测和政策学习之间的差距。基于这一见解,我们引入了 RynnWorld-4D,这是一种生成模型,可以在一个统一的扩散过程中从单个 RGB-D 图像和语言指令共同生成未来的 RGB 帧、深度图和光流。该 4D 世界模型采用三分支架构,将跨模式注意力与逐帧 3D RoPE 集成在一起,确保外观、几何形状和运动一致发展。为了大规模提供训练数据,我们策划了 Rynn4DDataset 1.0,这是一个包含超过 2.544 亿帧的海量数据集,涵盖以自我为中心的人类和机器人操作视频,并具有用于深度和光流的高质量伪标签。我们进一步提出了 RynnWorld-4D-Policy,这是一种逆动力学头,它在一次前向传递中消耗 RynnWorld-4D 的内部 4D 表示,绕过昂贵的多步去噪,以闭环方式输出机器人动作。实验表明,RynnWorld-4D 可以产生时间和空间相干的 4D 预测,并且 RynnWorld-4D-Policy 在现实世界灵巧双手操作任务中实现了最先进的性能,特别是在需要空间精度和时间协调的任务中表现出色。