论文

视频扩散模型对于手部运动重建的惊人效果

The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction

应用与实践视觉感知与空间理解

摘要

以自我为中心的视频进行 4D 手部运动重建受到现有方法明显局限性的瓶颈:基于图像的管道依赖于在严重遮挡下失败的检测器,而基于视频的方法依赖于仅从稀缺的手部姿势注释中学习的时间模块,窄信号不足以建模运动动力学、遮挡推理和手部物体交互。然而,这些能力正是视频生成模型在经过训练以在互联网规模上合成连贯视频时必须隐式获得的能力。受此启发,我们提出了 ViDiHand,它利用预训练视频扩散模型的表示来重建 4D 双手姿势。我们通过手覆盖渲染目标对其进行调整,该目标专门针对手的功能,同时保留其世界先验。然后,解码器从适应的特征中恢复公制尺度的姿势。整个流程直接在全帧上运行——没有检测器,没有填充器,也没有测试时间优化。在 ARCTIC、HOT3D 和 HOI4D 上,ViDiHand 的性能大大优于先前的方法,建立了视频扩散模型,作为手部运动重建的强大新基础,以及为具体人工智能进行可扩展的野外数据收集的有前途的途径。项目页面:https://vidihand.github.io。