论文

Agentic 通过学习排序和验证进行相对相机姿态估计

Agentic Relative Camera Pose Estimation via Learned Ranking and Verification

智能体系统Agent 工具调用

摘要

人们已经开发了多种用于相机姿态估计的方法,包括基于对应的方法、端到端姿态回归和最近的 3D 几何基础模型。我们的主要观察结果是,没有一个估计器能够完美应对各种挑战,例如宽基线、缺乏纹理、外观变化和遮挡。进一步的分析揭示了基准和单个图像对之间的巨大性能差异,不同的估计器表现出互补的优势。我们引入了 PoseAgent,这是一个用于相对相机姿态估计的 Agentic 框架,它通过可学习的排名和验证动态编排姿态估计器。给定图像对,分析Agent首先提取与姿态估计相关的外观、语义和几何特征,例如场景类型。然后,学习的排名Agent根据图像对轮廓预测多个姿势估计器的相对能力。执行排名最高的估计器,其预测姿势由学习验证Agent评估,该Agent估计相应的姿势误差。当验证失败时,PoseAgent 会自适应地调用排名较低的估计器,直到候选者被接受或达到执行预算。对于姿态验证,我们的验证网络比以前的模型更准确地预测姿态错误。对于姿势估计,与 ARKitScenes、MegaDepth、ScanNet++ 和 RealEstate10K 上最强的独立估计器相比,PoseAgent 将 AUC@5 度提高了 4.2%。在 ARKitScenes 上,PoseAgent 的性能也优于基于 VLM 的Agent,后者包括具有相同验证器和后备策略的 VLM 排名器。这些结果证明了我们学习的排名和验证的有效性。