论文

SUFLECA:扩大 CAD 到图像对齐的特征学习

SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment

应用与实践视觉感知与空间理解

摘要

CAD 到图像对齐旨在从单个 RGB 图像估计对象的 9D 姿态(旋转、平移和各向异性比例),并应用于机器人和增强现实。最近的零样本方法使用视觉基础模型将图像区域与 CAD 模型进行匹配;然而,它们的对应关系通常是外观驱动的,或者在遮挡或合成到真实域转换的情况下不可靠。为了解决这些限制,我们引入了 SUFLECA(CAD 到图像对齐的扩展特征学习),这是一种用于零样本 CAD 对齐的弱监督框架,具有两个关键贡献。首先,SUFLECA 通过对跨越多达 12 个真实和合成数据集的图像进行规范化对象坐标 (NOC) 监督,从预训练的视觉表示中扩展基于几何的特征学习,学习跨领域泛化的紧凑的几何感知特征。其次,我们提出了一种几何一致的匹配算法,可以建立可靠的 CAD 到图像的对应关系。这些贡献共同实现了每个对象实例的精确、亚秒级对齐,而无需迭代姿态细化。在 ScanNet25k 上,SUFLECA 实现了 32.8%/42.6% 的类别/实例准确率,以较小的计算占用量比最强的零样本基线高出 9.7/12.5 个百分点,并且首次在该基准测试中甚至超越了现有的姿态监督方法。代码位于:https://github.com/snt-arg/SUFLECA