论文
Embody4D:用于体现 4D 世界建模的通用数据引擎
Embody4D: A Generalist Data Engine for Embodied 4D World Modeling
摘要
实体代理需要强大而全面的 3D 时空表示来支持空间推理、操作理解和下游决策。然而,现有的机器人数据通常是从固定或稀疏的视点捕获的,仅提供部分和依赖于视图的观察,这限制了多视图感知和跨视点的泛化。考虑到在现实世界中收集额外视点的困难,我们提出了 Embody4D,这是一种用于具体场景的专用视频到视频世界模型,通过将单目机器人视频转换为来自灵活目标摄像机视点的新颖视图视频来弥补这种观察差距。首先,为了解决训练数据稀缺的问题,我们引入了 3D 感知组合合成管道来管理异构数据集,该数据集组合了具有不同背景的跨实施例机械臂,从而促进了广泛的泛化。其次,为了增强几何稳定性,我们设计了一种潜在的置信感知专家调制策略,该策略估计扭曲的潜在先验的可靠性,并自适应地将区域路由到复制、修复或修复专家,以实现时空一致的 4D 生成。最后,为了提高操作的保真度,我们采用了一种交互感知注意机制,该机制明确关注机器人交互区域。大量实验表明 Embody4D 在视觉评估基准上实现了最先进的性能,而模拟和现实世界的机器人实验进一步证明了它作为强大的数据引擎的有效性,用于合成高保真、视图一致的视频,从而增强下游机器人的规划和学习能力。