论文
来自未注释婴儿视频的人体姿势基础模型的交叉模型 蒸馏,用于无标记 3D 姿势估计
Cross-Model Distillation of a Human-Pose Foundation Model from Unannotated Infant Video for Markerless 3D Pose Estimation
摘要
自发运动是了解婴儿神经运动健康的最早窗口之一,对其进行评分的结构化临床仪器是经过验证的脑瘫风险早期预测因子。然而,它们需要经过专门训练的评估者,非常耗时,并且存在评估者之间的差异。这激发了基于视频的自动化无标记评估,特别是因为基于标记的动作捕捉对于婴儿来说是不切实际的。然而,使无标记捕捉成为可能的基础模型几乎完全是在成年人身上进行训练的:我们最近的多视图婴儿研究发现,没有一个模型能够同时具有强大的 2D 关键点准确性和跨不同模型的直接 3D 身体恢复。虽然该研究确定了这种权衡,但并没有解决它。在这里,我们仅使用未注释的婴儿视频执行从 Sapiens 2 姿势模型到 SAM 3D 身体模型的跨模型 蒸馏。冻结的教师提供密集的伪标签,可微渲染器在训练循环中将预测的网格与它们对齐。在我们之前研究的多视图协议下,对 11 个被保留的婴儿(18 个会话,173 个记录),微调 改善了同视图 2D 关键点与 Sapiens 参考的一致性(正确关键点的中位身体百分比 @ 10px 0.22 -> 0.42,面部 0.22 -> 0.42)和 Procrustes 对齐的每个关节的平均 3D 位置误差(25.5 -> 22.2 毫米)。这演示了跨模型 蒸馏 如何提高婴儿的 SAM 3D 身体模型性能。