论文

具有异步去噪功能的视频先验统一 4D 世界动作建模

Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising

模型架构新型架构

摘要

我们提出了 X-WAM,一种统一的 4D 世界模型,它将实时机器人动作执行和高保真 4D 世界合成(视频 + 3D 重建)统一在一个框架中,解决了先前统一世界模型(例如 UWM)的关键局限性,该模型仅对 2D 像素空间进行建模,无法平衡动作效率和世界建模质量。为了利用预训练视频扩散模型的强大视觉先验,X-WAM 通过预测多视图 RGB-D 视频来想象未来世界,并通过轻量级结构适应有效地获取空间信息:将预训练扩散 Transformer 的最后几个块复制到专用深度预测分支中,以重建未来空间信息。此外,我们提出异步噪声采样(ANS)来联合优化生成质量和动作解码效率。 ANS 在推理过程中应用专门的异步降噪计划,以更少的步骤快速解码动作,以实现高效的实时执行,同时专用于生成高保真视频的完整步骤序列。 ANS 不是在训练期间完全解耦时间步长,而是从联合分布中进行采样,以与推理分布保持一致。 X-WAM 经过超过 5,800 小时的机器人数据预训练,在 RoboCasa 和 RoboTwin 2.0 基准上实现了 79.2% 和 90.7% 的平均成功率,同时产生了在视觉和几何指标方面超越现有方法的高保真 4D 重建和生成。