论文
PACT:从视频中端到端学习人体姿势、接触和力
PACT: End-to-End Learning of Human Pose, Contacts, and Forces from Video
摘要
人体运动、环境接触和相互作用力受常见物理定律的控制,但现有方法通常将视觉姿势重建与接触和力估计分开。这种分离限制了联合推理,并且可能会在阶段之间传播错误。我们引入了 PACT,这是一种端到端模型,可以共同学习从单目视频中估计人体姿势、接触和接触力。我们的方法通过可学习的接触力标记和将视觉特征与世界空间运动集成的时间转换器增强了人体重建基础模型。联合预测头改进人体姿势并估计接触和力,而基于物理的监督则鼓励重建运动和相互作用力之间的一致性。为了解决力注释的稀缺问题,我们开发了一个数据注释管道,将接触标记与基于物理的运动和力优化相结合,从合成和真实视频中生成训练监督。我们还介绍了真实世界的攀爬基准 ForceWall,其中包含攀爬视频以及从力传感器获得的相应地面实况接触力。实验证明了最先进的接触和力估计,优于分阶段重建方法,并推广到训练分布之外的交互。这些结果支持端到端联合学习作为从视频中恢复人体运动和物理交互的有效方法。