论文

DepthWorld:机器人操作的 RGB 与深度世界模型

DepthWorld: 3D World Model for Robot Manipulation

模型架构混合架构

摘要

世界模型作为机器人传统模拟器的数据驱动替代,用于策略评测、改进和规划,均需要可靠三维几何。当前RGB视频世界模型逐帧看似正确,却不能构成一致三维世界。需要大规模操作3D监督及不破坏预训练视频先验的架构。我们提出标定管线,结合学习式立体深度和联合因子图,汇合同一机器人所有回合,共同恢复共享运动学参数和逐场景外参。在DROID上得到DROID-3D,提供稠密度量深度与重新标定多视角外参;90%回合的外部摄像机重投影误差低于0.7像素。DepthWorld基于Stable Video Diffusion,以空间潜变量平铺联合预测多视角RGB与深度,保持预训练VAE不变。同训练预算下,深度监督使RGB PSNR比相同RGB单模态基线提高1.48dB,并提供准确度量深度供下游几何推理。

DepthWorld:机器人操作的 RGB 与深度世界模型:论文原图
图2:DROID-3D标定管线。输入两外部摄像机和腕部摄像机的立体图像、机器人URDF及关节编码器读数。阶段1用学习式全局匹配恢复各视图度量深度,以稠密对应约束多视图一致。阶段2将URDF渲染到外部视图,使相机系统接地到机器人坐标,再联合所有回合构造因子图,恢复逐场景外参修正 $\delta T_{\text{ext1}}^{s}$、$\delta T_{\text{ext2}}^{s}$ 及共享运动学参数,包括手眼修正 $\delta T_{\text{wrist}}$ 和关节编码器偏移 $\delta\bm{q}$。