论文

RayTun3R:3D 基础模型中的在线相机自适应

RayTun3R: Online Camera Adaptation in 3D Foundation Models

模型训练参数高效训练

摘要

最近的 3D 基础模型,例如 DUSt3R、MASt3R、VGGT、$π^3$ 和 Depth Anything 3,提供了强大的前馈深度和对针孔图像的位姿估计,但在鱼眼相机几何结构下急剧退化。我们表明,这种失败部分是由于预训练 3D 基础模型的位置编码中的针孔相机偏差造成的,并提出了 RayTun3R,一种轻量级相机自适应方法。它保持预训练网络固定,并仅适应与词元位置和相机几何形状相关的轻量级组件。 RayTun3R 学习对绝对和旋转位置编码的参数高效残差校正,以及无参数标记化和对预测网格坐标的校正,以消除残差针孔假设。生成的适配器仅包含 10,752 个可训练参数,并且可以使用几何损失从短时间段中学习。经过调整后,RayTun3R 可以有效地传输到序列的其余帧,而不会产生额外的运行时间成本。在视场从 $110^\circ$ 到 $200^\circ$ 的不同鱼眼数据集中,我们的适配器相对于未适应的模型将旋转误差减少了 $2$-$12\times$,在使用 $\sim\!14\times$ 更少的可训练参数的同时优于 LoRA,在避免多视图推理成本的同时,改进了无适应基线的姿势,并且在深度精度方面保持了竞争力。