论文
VIDAR:通过几何基础模型进行视觉惯性密集对准和重建
VIDAR: Visual-Inertial Dense Alignment and Reconstruction via a Geometric Foundation Model
摘要
单目基础模型提供密集的几何形状,但通常缺乏稳定的公制比例。本文提出了 VIDAR,一种将 SVO+IMU 里程计与 Depth Anything 3 结合起来的视觉惯性密集重建框架。VIDAR 使用视觉惯性前端作为度量锚点:它提供相机姿态、比例和一致的世界框架,用于跨时间对齐密集基础模型预测。然后,基础模型提供详细的局部几何形状,并将其融合到全局重建中。我们研究了姿势条件 DA3 和解耦对齐策略。在 EuRoC 上,位姿注入将尺度误差降低至约 1\%,并达到 0.463 均值 F@0.10;解耦混合在没有 真值 姿势的情况下将其提高到 0.676。 EuRoC 和 TUM RGB-D 的结果表明,VIDAR 是度量密集单目重建的实用途径。