论文
WildHSR:根据 3D 基础模型进行公制前馈 4D 人物场景重建
WildHSR: Metric Feed-Forward 4D People-Scene Reconstruction from a 3D Foundation Model
摘要
3D 基础模型只需一次前向传递即可恢复摄像机和几何体,但其中一些最强大的模型已达到规模。联合人物场景重建需要两个缺失的输出:度量尺度和持久的人物身份。我们询问一种大规模的基础表示是否可以通过轻量级适应来支持两者。精确的度量标签很少,但未标记的野外视频却很多。我们使用策划的网络视频中的人来初始化解决方案:摆出的度量主体和 2D 关键点给出了近似的、封闭形式的尺度伪标签。这些伪标签预训练尺度读数,然后使用来自标准真实视频训练分割的精确度量监督与轻量级适配器一起进行微调。在推理时,头部根据基础模型标记预测公制比例,无需标尺或其教师。对于人员身份,我们单独探索预训练的基础模型,并找到证据表明其中间查询关键特征对跨帧的人员对应进行编码。在大多数评估的移动人物片段中,中间层标记更喜欢该人而不是空出的位置和其他人。一个微小的投影可以读取这封信;与公制骨盆运动和建议置信度一起,它驱动了每帧身体的垃圾箱感知 Sinkhorn 关联。 WildHSR 结合两种读数,从单目视频中重建公制摄像机、场景和人物。每个窗口都是前馈预测的;分析关联和 Sim(3) 组合连接窗口。在 EMDB-2 上,WildHSR 是已发布的比较中第一个击败基于最佳优化的 WA-MPJPE 和 RTE 的前馈方法,同时在所有三个世界框架指标上领先前馈方法。在 RICH 上,它领先于 WA-MPJPE 和 W-MPJPE 上的前馈人物和场景方法。完整的管道在一个 GPU 上以 10.1 fps 的速度运行。