论文

HuC-VideoMAE:以合成人体视频进行结构感知预训练

HuC-VideoMAE: Human-Centric Video Masked Autoencoding from synthetic data

模型训练合成数据

摘要

现代动作识别模型依赖于对大量网络爬虫视频进行预训练的视频转换器,例如 Kinetics-700。然而,使用此类数据会引起道德问题,因为通常不会获得受试者的同意。最近从动作捕捉数据生成的高质量合成视频数据集(例如 BEDLAM2.0)提供了一种有前途的道德替代方案。在这项工作中,我们研究了视频转换器在合成人体运动数据集上的自监督预训练。我们首先表明,直接应用标准 VideoMAE 掩蔽策略会导致性能比 Kinetics 预训练差很多。为了解决这个限制,我们提出了一种以人为中心的掩蔽方案,该方案利用身体关键点和人体边界框区域。我们的方法鼓励模型在预训练期间关注人体运动的结构和动力学。 NTU RGB+D 和 Toyota-Smarthome 上的实验表明,我们的方法在合成数据上的性能显着优于标准 VideoMAE 预训练,在预训练期间不使用单个真实帧的情况下,在 NTU RGB+D 跨视图主题上与动力学预训练的差距缩小了 49%。为了促进道德行为识别模型的使用,我们将公开发布我们的预训练模型。

HuC-VideoMAE:以合成人体视频进行结构感知预训练:论文原图
图 1:身体关键点引导掩蔽。从具有 $2$D 关键点和人物框注释 (a) 的合成帧中,每个补丁都被标记为关键点、主体(框内)或背景 (b),并接收掩蔽得分 $\rho$ (c):背景得分高于主体,关键点最低,因此稀疏关节结构在掩码中幸存下来。例外情况是选择用于身份屏蔽的关节($\in\mathcal{S}$,红色),其分数高于背景,因此始终被屏蔽。