论文

MINT:来自可扩展自我中心管道监督的世界空间相机和手部运动估计的统一模型

MINT: A Unified Model for World-Space Camera and Hand Motion Estimation from Scalable Egocentric Pipeline Supervision

模型训练预训练

摘要

从以自我为中心的视频中恢复世界坐标中的相机和手部运动是活动理解、机器人学习和增强现实的关键功能。现有系统通常将这个问题分解为相机运动、深度估计、手部重建和轨迹细化的单独阶段,从而导致大量的计算开销并阻碍相机和手部运动的联合建模。我们介绍 MINT(Minting IN-the-Wild Trajectories),这是一种根据以自我为中心的 RGB 视频重建世界空间手部运动的基础模型。 MINT 从单个共享时空视频表示中联合预测摄像机轨迹、视场 (FoV)、摄像机帧手部状态和每帧手部可观察性,然后通过显式坐标变换生成世界空间手部运动。大规模训练这样的模型具有挑战性,因为配对的世界空间相机和手动注释很少。因此,我们开发了一个开源标签 EGOPIPELINE,它将大量公共以自我为中心的视频转换为结构化的相机和手部轨迹监督。 MINT 首先对这些大规模伪标签进行预训练,然后对一小组高质量的相机和手注释进行微调。在公共基准测试中,MINT 在训练中没有看到任何基准测试的情况下都达到了最先进的精度,达到 0.945 帧精度、13.646 mm PA-MPJPE-p 和 55.058 px EPE-p 用于 HOT3D 上的相机帧双手重建、4.690 mm RPE-T 和 0.284 度 RPE-R 用于相机轨迹,以及 3.67x 端到端比监督它的标签管道加速。我们发布了模型、训练和推理代码、标签管道以及精心策划的 1,021 小时以自我为中心的轨迹数据集。