论文

校准检索几何:用于视觉位置识别的可靠性引导免训练聚合

Calibrating Retrieval Geometry: Reliability-Guided Training-Free Aggregation for Visual Place Recognition

应用与实践视觉感知与空间理解

摘要

冻结的视觉基础模型为视觉位置识别提供了可转移的特征,但固定的聚合可能会抑制新环境中的有用区别。我们引入了 TFA,一种以可靠性为导向、无需训练的聚合方法,既不需要地点标签,也不需要特定于任务的权重更新。我们的主要观察是,可重复的检索不需要具有歧视性:独立的密码本可以一致地检索一些数据库中心。 TFA 结合了跨码本协议、检索覆盖范围和频谱统计来控制残差分配、频谱整形和全局特征融合。其谱核在零干预下准确地恢复了原始描述符相似性。仅数据库 TFA 在访问查询之前修复其规则; TFA-C64 使用 64 个不相交的未标记目标图像来校准后续查询的检索。在具有固定 DINOv2-B 主干和匹配分辨率的 20 个地面协议中,仅数据库 TFA 将 Recall@1 相对于 AnyLoc 在 MSLS-val 上提高了 17.39 个百分点,在 SPED 上提高了 9.55 个百分点。 C64 减少了驾驶环境中纯数据库校准的失败。在 8 个空中/交叉视图协议中,TFA 在 16 个 DINOv2/DINOv3 主干协议组合中的 14 个中,在免训练头中实现了最高的 Recall@1。在单独的本机系统比较中,基于 DINOv2-G 的 TFA-C64 在 Pitts30k 上达到 91.46% Recall@1,在 VPAIR 上达到 76.29%,在所有五个基准上均优于显示的免训练比较器。这些结果表明,可靠性引导的聚合可以从冻结的表示中恢复额外的检索能力,为具有稀缺位置监督的新环境提供实用的基线。