论文
VI3:利用惯性线索为预训练的 3D 基础模型奠定基础
VI3: Grounding Pretrained 3D Foundation Models with Inertial Cues
摘要
3D 基础模型 (3DFM) 擅长从场景的多个视图预测相机姿势和密集深度,展现出强大的零样本泛化能力。然而,由于从单目图像中无法观察到公制尺度,因此它们的绝对尺度预测通常不准确。大多数设备中都存在惯性测量单元 (IMU),通过观察缩放运动来自然地补充单目相机。我们引入了 VI3,这是一个与模型无关的框架,仅使用 IMU 读数来度量锚定预训练的 3DFM。 VI3 初始化并预积分 IMU,以获得公制运动参考,然后用于恢复 3DFM 输出的比例。我们的方法包括针对不同 3DFM 架构量身定制的适应性锚定策略。对合成和真实航空数据集的实验表明,VI3 在没有 真值 监督的情况下恢复公制尺度,同时保持几何一致性,在条件良好的运动下充当精细细化,并在运动信息量较少时充当强先验。