论文
EgoFound3R:具有逐点交互属性的世界空间中端到端的以自我为中心的手部重建
EgoFound3R: End-to-End Egocentric Hand Reconstruction in World Space with Point-Wise Interaction Attributes
摘要
以自我为中心的视频已成为具体模型监督的主要来源,其价值在于恢复世界坐标中的手部运动,而相机运动和手部遮挡使得恢复手部运动变得困难。现有的重建流程通常将手部和场景估计分开,将交互属性留给单独的特定于任务的模型,并为每个视频调用多个模型,因此先前的重建模型无法估计这些属性,并且吞吐量成为大规模注释的实际约束。因此,我们引入了 EgoFound3R,这是一个统一的端到端模型,它以与场景共享的公制尺度估计世界空间手部几何形状,并预测逐点交互属性,包括可见性、接触和距离。该模型集成了三种设计:(i)结构化手部提示,将预先训练的几何先验转移到世界空间手部重建; (ii) 解码手部几何形状和交互属性的显式手部表示; (iii) 共享参数多速率设计可降低推理成本。这些设计一起可以一次性预测手的几何形状和逐点属性。在 OakInk-v2、TACO 和 HOI4D 上,EgoFound3R 比以前的方法将平均每关节位置误差 (MPJPE) 降低了 43.2%、22.4% 和 11.6%,并在同一通道中预测沿几何形状的点接触和距离,同时获得大约 6 倍的吞吐量。