论文
学习单参考未见物体姿态估计的跨视图语义先验
Learning Cross-View Semantic Priors for Single-Reference Unseen Object Pose Estimation
摘要
单参考未见对象 6D 姿态估计通过仅从一个参考视图估计任意新对象的姿态来减少对象引导。最近基于对应关系的管道通过视觉基础模型 (VFM) 功能实现了强大的性能。然而,他们通常将这些特征视为视图内描述符,留下密集的视觉语义线索,包括外观、结构和上下文,在几何解码之前在视图之间交换不足。因此,解码的点特征可能缺乏联合语义和几何可辨别性,使得对应估计在具有挑战性的情况下仍然很困难。我们不是独立处理特征,而是围绕早期的跨视图语义先验构建对应管道。具体来说,跨视图语义交互(CVSI)使密集查询和引用 VFM 词元能够交换语义上下文并形成跨视图先验。然而,直接 CVSI 可能会扰乱 VFM 词元结构,而所得的语义先验仍然需要 3D 表示一致性才能实现严格对应。为了使该 CVSI 先验对于 3D 对应学习而言可靠,我们引入了两个互补的训练时间约束:视图内结构保留 (IVSP) 损失在交互过程中保留原始视图内标记亲和结构,而参考锚定几何一致性 (RAGC) 损失则强制解码点特征的空间表示一致性。最终姿势是通过加权 SVD 从学习到的对应关系中恢复的。我们进一步从 BOP 挑战数据集 YCB-V 和 TUD-L 构建了一个具有挑战性的视图对协议,以评估困难匹配场景中的鲁棒性。在不同视图对设置下对六个基准进行的广泛实验表明,我们的方法在保持相当的推理速度的同时实现了最先进的性能。