论文

6D 位姿估计中条件流匹配的基础特征融合

Foundational feature fusion for conditional flow matching in 6D pose estimation

应用与实践视觉感知与空间理解

摘要

条件流匹配使对象 6D 姿态估计向前迈进了一步,通过逐步去噪并将对象表示注册到观察到的场景,实现了最先进的性能。现有方法需要训练特定于任务的编码器,并在对象场景重叠的情况下进行监督,并依靠简单的特征融合策略来解决姿势模糊性。我们提出了 FunFlow6D,这是一种新颖的基于流匹配的公式,它利用几何和外观基础模型的特征进行姿势估计,从而无需进行特定于任务的编码器训练。我们还引入了一种基于交叉注意的融合机制,该机制动态地结合几何和外观特征,为流匹配模块提供更丰富的调节。对 BOP 基准测试的四个数据集进行的实验表明,FunFlow6D 的性能优于之前的技术水平,同时减少了监督要求和内存开销。广泛的消融验证了每个提议组件的贡献。项目网站:https://tev-fbk.github.io/FunFlow6D/。