论文
使用大型重建模型重建人与物的交互
Reconstructing Humans and Objects in Interaction using Large Reconstruction Models
摘要
3D 中人与物体交互的估计 (3D HOI) 是 3D 计算机视觉中的一个基本问题,在 AR/VR、机器人和嵌入式 AI 中都有应用。然而,由于深度模糊、遮挡和物体形状可变性,在 3D 中重建这些交互仍然具有挑战性。现有方法主要关注重投影和接触约束,将参数化人体模型和对象模板拟合到 2D 图像。在本文中,我们探索了一条不同的途径。我们提出了 MILO,这是一个利用大型重建模型 (LRM) 的视觉功能从单个图像中恢复详细的 3D 人与物体交互的框架。我们的主要观察结果是,LRM 提供了一个强大的几何支架,可以保留相对的人-物体排列和邻近线索。这显着简化了重建过程,将问题重新定义为解释 LRM 网格:我们将其分割为人体和物体组件,将参数化身体模型拟合到人体部分,并可选择将物体模板与物体部分对齐(如果这样的模板可用)。 MILO 实现了强大的重建精度,并在多个基准和交互场景中优于现有基线。我们的代码可在 https://ac5113.github.io/MILO 获取。