论文

XDG:加速视觉消歧

XDG: Accelerated Visual Disambiguation

模型推理推理加速

摘要

视觉混叠(也称为分身问题)仍然是运动结构 (SfM) 的一个关键挑战:视觉上相似但物理上不同的表面可能会产生不正确的图像匹配并降低重建质量。之前的工作通过几何感知的基础模型功能缓解了这个问题,但在主干之上放置了一个重型 Transformer 分类器,使得大规模消歧变得昂贵。我们引入 XDG,这是一种专为可扩展的 SfM 设计的高效视觉消歧模型。我们的主要观察结果是,3D 基础模型已经执行了视觉消歧所需的跨视图几何推理,因此分身分类应该直接调整主干表示,而不是在单独的重型解码器中重新学习成对推理。 XDG 使用轻量级 LoRA 适配器对 Depth Anything 3 进行微调,并将其相机标记重新调整为紧凑的配对级分类标记。紧凑的 MLP 头可预测候选图像对是否观察到相同的 3D 表面。大量实验表明,XDG 提供了有利的准确性与效率权衡:它在成对和重建基准上与最先进的消歧方法保持竞争力,并提供超过 3 倍的推理加速。在包含数千张图像的单个 LaMAR 场景中,XDG 节省了 10 多个小时的视觉消歧处理时间。代码可在 https://github.com/xtcpete/xdg 获取。