论文
EV-CLIP:视觉挑战下少镜头动作识别中 CLIP 的高效视觉提示适应
EV-CLIP: Efficient Visual Prompt Adaptation for CLIP in Few-shot Action Recognition under Visual Challenges
摘要
CLIP 通过自然语言监督在视觉领域展示了强大的泛化能力,甚至对于视频动作识别也是如此。然而,大多数现有的采用 CLIP 进行动作识别的方法主要集中在时间建模上,往往忽视了空间感知。在现实场景中,弱光环境或以自我为中心的观点等视觉挑战可能会严重损害空间理解,而空间理解是有效时间推理的重要前提。为了解决这个限制,我们提出了 Efficient Visual Prompting for CLIP (EV-CLIP),这是一种高效的适应框架,专为跨不同场景和视点的少镜头视频动作识别而设计。 EV-CLIP 引入了两种视觉提示:掩模提示(通过重新加权像素来引导模型对动作相关区域的注意力)和上下文提示(通过将逐帧特征压缩为紧凑表示来执行轻量级时间建模)。为了进行全面评估,我们整理了五个基准数据集并分析领域转移,以量化不同视觉和语义因素对动作识别的影响。实验结果表明,EV-CLIP 在整体性能上优于现有的参数高效方法。此外,它的效率仍然独立于主干规模,使其非常适合在现实世界、资源受限的场景中部署。代码可在 https://github.com/AI-CV-Lab/EV-CLIP 获取。