论文
从以自我为中心的视频中看世界和自我
Seeing the World and the Self from Egocentric Video
摘要
以自我为中心的视频的完整 3D 感知需要在共享公制框架中恢复周围场景和佩戴者的全身运动。现有方法通常分别解决场景重建和运动估计:场景重建方法忽略佩戴者,而运动估计方法缺乏明确的场景几何形状并且通常依赖于外部轨迹。联合恢复具有挑战性,因为这两个任务表现出不对称的可见性并且需要不同的预测范例。大部分可见的场景支持确定性几何回归,而严重遮挡的身体则需要生成运动推理。因此,我们提出RESELF(重建场景和sELF),这是一个将确定性度量几何重建与几何条件运动生成结合起来的统一框架。 RESELF 使用逐帧尺度和相对姿势一致性目标,将在大规模外心数据上预先训练的几何基础模型适应以自我为中心的视频。由此产生的相机轨迹和潜在的几何特征决定了恢复佩戴者运动的扩散模型。随后的闭环运动反馈阶段进一步细化摄像头,同时保留重建的场景几何形状。为了支持训练和评估,我们通过对齐以自我为中心的视频、稀疏度量场景几何、相机轨迹和全身运动注释,从 EgoExo4D 中策划 EE4D-JSM。实验表明,RESELF 的性能优于为深度估计、相机跟踪和全身运动估计等各个任务设计的最先进方法。代码、模型和数据集将在 https://ka1guan.github.io/RESELF/ 提供。