论文

场景和人类同在一个世界:前馈通道中的重建

Scene and Human in One World: Reconstruction in a Feedforward Pass

应用与实践视觉感知与空间理解

摘要

由于尺度模糊、人体场景错位和遮挡干扰,从移动单目摄像机重建动态场景中的人体仍然具有挑战性。我们认为,准确的人体场景重建需要这两个任务相互告知,而不是将人体网格恢复和场景重建视为单独的任务:参数人体模型提供语义结构和度量尺度先验,而场景几何为人体定位和对齐提供空间上下文。基于这一见解,我们引入了 SHOW,这是一种掩模提示的人体网格恢复框架,它将前馈 3D 场景重建与统一度量空间中的人体网格恢复结合起来。 SHOW 将参数化人类模型中的人类语义和尺度先验注入到标准化点图预测中,从而能够从固有尺度模糊的单目输入中进行度量尺度场景重建。反过来,恢复的场景几何形状限制了人体网格估计,鼓励空间一致的人体放置并改进人体场景对齐。为了处理复杂的多人和杂乱场景,SHOW 进一步融入了即时遮蔽机制,可以实现灵活的目标人选择,同时抑制背景干扰和遮挡干扰。通过联合训练,该模型学习人类感知的几何特征和几何约束的人类特征,从单眼以人类为中心的视频生成对齐的度量尺度重建。大量实验表明,SHOW 在具有挑战性的相机运动、遮挡和杂乱背景下提高了公制尺度一致性、人体场景对齐和重建精度。