论文

ACE-Ego-Hand:重新利用视频扩散模型以实现遮挡稳健的以自我为中心的 3D 手部运动恢复

ACE-Ego-Hand: Repurposing Video Diffusion Models for Occlusion-Robust Egocentric 3D Hand Motion Recovery

应用与实践视觉感知与空间理解

摘要

以自我为中心的视频为嵌入式人工智能提供了可扩展的操作数据,但由于严重的物体遮挡和频繁的视线外间隙,恢复公制 3D 手部轨迹仍然具有挑战性。当手短暂离开帧时,现有的单帧和窗口时间回归器会失败,而最近的视频扩散模型(VDM)依赖于大量随机多步采样作为像素空间渲染器。相反,我们将 VDM 重新调整为确定性几何编码器。对干净潜伏的一次前向传播会暴露当前观察范围之外的场景内容,包括被遮挡和视线外的手。我们引入了 ACE-Ego-Hand,这是一个离线剪辑级框架,它通过确定性清洁潜在编码器提取特征,并使用双向时空解码器对其进行解码。 ACE-Ego-Hand 通过公制放置恢复连续双手轨迹,无需外部检测器,而基于射线的相机解算器支持第二种配置,无需测试时相机内部函数。在五个以自我为中心的基准测试中,ACE-Ego-Hand 树立了新的技术水平,将 MPJPE-p 在遮挡严重的 ARCTIC 上降低了 30%,在 HOT3D 上降低了 40%。一旦将视线外的手纳入评估中,这些增益将达到 46%-61%,从而提供从日常人类视频到机器人操作数据的可扩展路径。