论文
OccluDex:用于自遮挡下以自我为中心的灵巧操作的分层 3D 视觉触觉表征学习
OccluDex: Hierarchical 3D Visuo-Tactile Representation Learning for Egocentric Dexterous Manipulation under Self-Occlusion
摘要
可靠的灵巧操作需要在整个交互过程中持续估计物体的几何形状和手与物体的接触。然而,在以自我为中心的传感中,操纵手经常遮挡与任务相关的物体表面和接触区域,减少了可用于状态估计的视觉证据,从而使鲁棒的闭环控制和对不可见物体几何形状的概括特别具有挑战性。为了解决这个问题,我们提出了 OccluDex,这是一种分层 3D 视觉触觉表示学习框架,它将全局几何结构与局部接触信息集成在一起,以便在手部物体交互期间在动态自遮挡下进行鲁棒操作。 OccluDex 采用多尺度掩码自动编码来逐步编码部分 3D 几何形状,并通过跨模态注意力将触觉接触标记与高级几何特征融合。编码器根据同步的人类视觉触觉演示进行预训练,并作为下游强化学习的冻结感知骨干进行传输。我们在水龙头旋转任务(需要顺时针手柄旋转一整圈)和桌面对象重新定向任务(需要 180 度桌面对象重新定向而不倾倒)上评估 OccluDex。在模拟实验中,与最先进的基线模型相比,OccluDex 对未见过的物体的准确度提高了 12.6%,对以前见过的物体的准确度提高了 8.3%。使用“影子手”进一步进行了物理实验,以证明对看不见的物理对象的成功的零样本模拟到真实的概括。这一结果可以使人形机器人以自我为中心的物体操纵可见和不可见的物体,即使操纵的机器人手遮挡了视觉。