论文
4DVGGT-D:具有改进的动态深度估计的 4D 视觉几何 Transformer
4DVGGT-D: 4D Visual Geometry Transformer with Improved Dynamic Depth Estimation
摘要
从单目视频重建动态 4D 场景是一项基本但具有挑战性的任务。虽然最近的 3D 基础模型提供了强大的几何先验,但它们的性能在动态环境中显着下降。这种退化源于一种基本的张力:全局注意力机制中相机自我运动和物体运动的固有耦合。在本文中,我们提出了一种新颖的 无需训练 渐进解耦框架,以原则性的、从粗到细的方式将动态与静态分离。我们的核心见解是通过首先稳定相机姿势,然后进行几何细化来解决张力。具体来说,我们的方法由三个协同组件组成:(1)动态掩模引导姿势解耦模块,将姿势估计与动态干扰隔离,产生稳定的无运动参考系; (2) 拓扑子空间手术机制,可正交分解深度流形,安全地保留动态对象,同时将精细的、掩模感知的几何体注入静态区域; (3) 信息论置信感知融合策略,将深度积分制定为异方差贝叶斯推理问题,通过逆方差加权自适应地混合多通道预测。对标准 4D 重建基准的大量实验表明,我们的方法在主要点云指标上实现了一致且实质性的改进。值得注意的是,我们的方法在不需要 微调 的情况下在鲁棒的 4D 场景重建中显示出有竞争力的性能,这表明了基于数学的动态-静态解开的潜力。