论文
UniPose9D:通用的类别不可知的物体姿态估计
UniPose9D: Universal Category-Agnostic Object Pose Estimation
摘要
物体姿态估计是 3D 视觉中的一个基本问题。尽管最近最先进的方法取得了强劲的性能,但它们常常过度适合现有的基准,并且对新类别和未见过的场景表现出有限的泛化能力。我们提出了 UniPose9D,一种用于 9D 对象姿态估计的类别无关基础模型:给定实例掩模/ROI 和 RGB-D 观察或具有预测深度的 RGB 图像,该模型无需类别标签、CAD 模型、平均形状先验或参考视图即可估计旋转、平移和度量大小。具体来说,UniPose9D 从观察到的对象几何形状中采样点对,并使用 DINOv2 和 PointNet 特征来预测每对的 NOCS 坐标。为了提高准确性,我们引入了一种具有自适应阈值的基于点对的 RANSAC N-hop Kabsch-Umeyama 算法。我们进一步采用流匹配来解决对称模糊性,并通过整理和对齐现有公共数据集中的姿势注释来构建大规模训练集。六个数据集的实验表明,单个统一模型可以匹配或超越专业方法,同时推广到看不见的物体和野外场景。我们的代码和模型可以在 https://github.com/qq456cvb/UniPose9D 上找到。