论文
未来动态 3D 重建:通过解开自我运动进行 3D 世界建模
Future Dynamic 3D Reconstruction: Toward 3D World Modeling with Disentangled Ego-Motion
摘要
预测动态环境的演变对于自主代理至关重要。虽然生成世界模型通过在图像平面内混合自我运动和环境动力学,在 2D 视频合成中实现了高度真实感,但它们表现出物理不一致,例如物体变形或消失,尤其是在较长的时间范围内。在本文中,我们提出了 FR3D,这是一种世界建模方法,可以预测未来动态 3D 重建的持久 3D 潜在表示。与之前将世界视为一系列基于图像的特征的作品不同,FR3D 明确地将场景的 3D 演化与代理的轨迹分离,将推断的自我运动视为动作的潜在代理。这种解开解决了自运动和世界运动之间的模糊性,确保了未来的几何一致性。此外,我们引入了一种师生 蒸馏 策略,该策略利用现成基础模型的空间“常识”,从而实现稳健的零样本泛化。大量实验证明,FR3D 在通过多个数据集的单目观察进行未来动态 3D 重建(甚至是未来 2 秒)方面具有强大的性能。项目页面:https://fr3d-wm.github.io。