论文
一个视频,一个世界:将单目视频转变为物理 4D 场景
One Video, One World: Turning Monocular Video into Physical 4D Scenes
摘要
我们引入了 \textbf{OVOW},这是第一个 无需训练 系统,它可以从单个单目视频重建 \emph{实例级,模拟就绪} 4D 网格场景。最近的 4D 重建实现了令人印象深刻的渲染质量,但其输出(例如隐式场、高斯基元或点云)缺乏物理模拟器和具体人工智能所需的无懈可击的拓扑、实例分离和标准化物理接口。 OVOW 通过四阶段管道弥补了这一差距:视觉语言模型对所有实例进行发现、标记和运动分类;类别感知重建为刚性物体生成每个实例的网格,为可变形物体生成拓扑一致的网格序列;迭代渲染匹配优化过程恢复公制尺度和 6-DoF 位姿轨迹;基于物理的装配加强了地面接触和物体间的支撑。至关重要的是,我们通过直接顶点变形对所有运动(刚性和非刚性)进行建模,无需特定类别的先验或骨架绑定,从而生成严密的网格场景,为下游物理模拟和编辑做好准备。我们进一步建立了 \emph{结构化视频到 4D} 评估的第一个基准,其中包括几何正确性、实例分离和超越视觉保真度的物理合理性指标;同一管道还可以充当可扩展引擎,用于合成配对视频到 4D 模拟数据,以用于未来 4D 世界模型和具体人工智能。在两个综合基准(静态和 4D)中,OVOW 在所有基准中实现了最佳的整体布局和几何精度以及最低的光度和语义错误,并且在单目视频上的运行速度比基准快一到两个数量级,而下游物理模拟证实了其物理稳定性。