论文
用于开放词汇动作识别的时空相似性体积聚合
Spatio-Temporal Similarity Volume Aggregation for Open-Vocabulary Action Recognition
摘要
最近的开放词汇动作识别(OVAR)方法通常在计算文本对齐之前将视觉特征聚合成全局表示,这一过程会模糊局部补丁信息和细粒度的时空线索。我们提出了相似性体积聚合(SimVA),这是一个从补丁级视觉文本相似性构建密集 4D 时空相似性体积的框架。 SimVA 在本地视频标记和动作类上构建时空相似量,并采用类采样来确保相似性聚合可扩展到大型词汇表。通过空间聚合来细化相似量,这将局部相似性模式置于上下文中以提高帧内一致性。运动感知调制进一步注入帧间变化线索,突出显示动态变化的区域。然后,基于 Mamba 的时间聚合对跨帧的类条件相似性模式的演变进行建模。通过保持密集的视觉-文本对应关系,SimVA 有效地将 CLIP 转移到视频动作识别,在零样本、少样本和从基础到新颖的基准测试中实现具有竞争力的性能。