论文
GenPrior:释放文本到运动生成先验,实现零样本骨架动作识别
GenPrior: Unleashing Text-to-Motion Generative Priors for Zero-Shot Skeleton-based Action Recognition
摘要
零镜头基于骨架的动作识别(ZSAR)旨在通过将骨架特征与文本语义对齐来识别看不见的动作类别。然而,现有的方法依赖于文本衍生的原型,这些原型本质上缺乏几何结构和物理约束,导致明显的\textit{语义运动差距}。为了弥补这一差距,我们提出了 \textbf{GenPrior},这是第一个利用 ZSAR 预训练文本到运动 (T2M) 模型的生成先验的框架。具体来说,我们引入了色散门控特征融合,它从生成运动序列中提取运动学原型和类内色散,并采用学习门控网络自适应地将可靠的结构线索注入文本嵌入,同时抑制合成伪影。此外,我们提出了生成原型细化,它利用这些生成增强原型作为锚来挖掘高置信度的未见样本,将类原型校准到真实分布,从而释放强大的性能增益。在 NTU-60、NTU-120 和 PKU-MMD 上进行的大量实验表明,GenPrior 在零样本和广义零样本设置下均实现了最先进的性能。代码可在 https://github.com/jidongkuang/GenPrior 获取。