论文
OMNI-PoseX:面向具身任务的快速六自由度物体位姿估计
OMNI-PoseX: A Fast Vision Model for 6D Object Pose Estimation in Embodied Tasks
摘要
准确的 6D 物体位姿估计是实体代理的一项基本功能,但在开放世界环境中仍然具有挑战性。许多现有方法通常依赖于闭集假设或与几何无关的回归方案,限制了它们在机器人系统中的泛化性、稳定性和实时适用性。我们提出了 OMNI-PoseX,这是一种视觉基础模型,它引入了一种新颖的网络架构,将开放词汇感知与 SO(3) 感知的反射流匹配姿势预测器相结合。该架构将对象级理解与几何一致的旋转推理解耦,并采用轻量级多模态融合策略,在紧凑的语义嵌入上调节旋转敏感的几何特征,从而实现高效稳定的 6D 位姿估计。为了增强鲁棒性和泛化性,该模型在大规模 6D 位姿数据集上进行训练,利用广泛的对象多样性、视点变化和场景复杂性来构建可扩展的开放世界位姿主干。基准位姿估计、消融研究、零样本泛化和系统级机器人抓取集成的综合评估证明了 OMNI-PoseX 的有效性。 OMNI-PoseX 实现了 SOTA 位姿精度和实时效率,同时提供几何一致的预测,从而能够可靠地抓取各种以前未见过的物体。