论文

ProxyPose:通过视频到视频转换进行 6-DoF 姿势跟踪

ProxyPose: 6-DoF Pose Tracking via Video-to-Video Translation

应用与实践视觉感知与空间理解

摘要

从单目视频中跟踪物体和表面的六自由度 (6-DoF) 位姿是计算机视觉中长期存在的问题。为了解决这个问题,现有的方法需要视频本身之外的输入,例如 3D 模型、深度图、对象蒙版或特定于任务的学习特征,并且它们难以处理无纹理、透明、反射或可变形的表面。在这里,我们介绍 ProxyPose,它将 6-DoF 姿势跟踪重新定义为视频到视频的转换。仅给定第一帧中的视频和单个标记像素,微调视频扩散模型将输入转换为代理视频 - 描绘彩色多面体的合成视频,该彩色多面体经历与标记像素处的表面区域相同的局部刚体运动。由于代理的几何形状和外观通过构造已知,因此恢复其完整的 6-DoF 轨迹可简化为使用现成解算器进行经典姿态估计。该公式利用大规模视频 预训练 将姿势跟踪的最困难方面(处理具有挑战性的材料、遮挡和变形)吸收到转换步骤中,同时在像素级别操作,无需对对象身份、边界或全局刚性进行假设。 ProxyPose 实现了最先进的 6-DoF 姿态跟踪精度,无需竞争方法所需的额外输入,并且在 微调 之后,视频模型仅基于合成数据。我们进一步证明 ProxyPose 可以扩展到人脸跟踪、相机姿势估计和具有挑战性的野外场景,这些都超出了现有方法的范围。项目页面:https://ruihangzhang97.github.io/proxypose/。