论文
具有不确定性感知先验的鲁棒 4D 视觉几何 Transformer
Robust 4D Visual Geometry Transformer with Uncertainty-Aware Priors
摘要
重建动态 4D 场景是一项重要但具有挑战性的任务。虽然 VGGT 等 3D 基础模型在静态设置中表现出色,但它们经常难以处理动态序列,因为运动会导致严重的几何模糊性。为了解决这个问题,我们提出了一个框架,旨在通过对重建过程不同阶段的不确定性进行建模来解开动态和静态组件。我们的方法引入了三种协同机制:(1)熵引导子空间投影,它利用信息论加权自适应聚合多头注意力分布,有效地将动态运动线索与语义噪声隔离; (2) 局部一致性驱动的几何净化,通过基于半径的邻域约束强制空间连续性,以消除结构异常值; (3)不确定性感知跨视图一致性,它将多视图投影细化表述为异方差最大似然估计问题,利用深度置信度作为概率权重。动态基准实验表明,我们的方法优于当前最先进的方法,将平均精度误差降低了 13.43%,并将分割 F 测量提高了 10.49%。我们的框架保持了前馈推理的效率,并且不需要特定于任务的 微调 或每个场景的优化。