论文
使用本体感觉和多接触触摸在手部遮挡下进行符合物理规律的 3D 生成重建
Physically Grounded 3D Generative Reconstruction under Hand Occlusion using Proprioception and Multi-Contact Touch
摘要
我们提出了一种多模态、基于物理的方法,用于严重手部遮挡下的公制尺度非模态对象重建和姿势估计。与之前仅依赖于视觉的遮挡感知 3D 生成方法不同,我们利用物理交互信号:本体感觉提供摆好的手部几何形状,多接触触摸限制物体表面必须位于的位置,从而减少遮挡区域的模糊性。我们将对象结构表示为姿势感知、相机对齐的符号距离场 (SDF),并使用 Structure-VAE 学习紧凑的潜在空间。在这个潜在空间中,我们训练一个条件流匹配扩散模型,对仅视觉图像进行预训练,并对遮挡操作场景进行微调,同时以可见 RGB 证据、遮挡器/可见性掩模、手部潜在表示和触觉信息为条件。至关重要的是,我们在微调和推理过程中结合了基于物理的目标和可微的解码器指导,以减少手-物体的相互渗透,并使重建的表面与接触观察对齐。因为我们的方法产生了度量的、物理上一致的结构估计,所以它自然地集成到现有的两阶段重建管道中,其中下游模块细化几何形状并预测外观。模拟实验表明,与仅视觉基线相比,添加本体感觉和触觉可显着提高遮挡下的完成度,并在正确的现实世界尺度下产生物理上合理的重建;我们通过将模型部署在真实的人形机器人上来进一步验证传输,该机器人的末端执行器与训练期间使用的末端执行器不同。