论文

T-MOR:学习用于人类动作识别的运动感知骨骼表示

T-MOR: Learning Motion-Aware Skeleton Representations for Human Action Recognition

模型训练预训练

摘要

CLIP 等视觉语言模型最近在广泛的视觉理解任务中取得了强劲的性能。然而,大多数现有模型主要依赖于图像或视频的外观级监督,并且没有明确地模拟人体运动,这对于细粒度和以人为中心的动作识别任务至关重要,因为动作是由时间结构和以物理规律为依据的身体运动定义的。为了解决这个问题,我们提出了可转移骨架运动表示(T-MOR),这是一种运动感知框架,可以在训练期间借助视频和语言监督从骨架序列中学习可转移动作表示。 T-MOR 采用多模态对比学习方案,将骨骼运动与视觉和文本表示对齐,同时仅使用轻量级骨骼输入进行推理。为了支持大规模 预训练,我们构建了 PoseCap-1M,这是一个新数据集,其中包含超过一百万个同步视频、骨架和文本三元组,涵盖不同的人类活动。我们在一系列以人为中心的动作识别基准上评估 T-MOR,包括动作分类和逐帧时间检测。实验结果表明,T-MOR 持续提高了多个数据集的性能,例如 Toyota Smarthome、Penn Action、UAV-Human、TSU 和 Charades。此外,T-MOR 在少样本和零样本设置中表现出强大的泛化能力,突出了以运动为中心和具体表示对于可转移动作理解的有效性。