论文

LEViL:通过 VLM 生成的伪标签空间上的零样本 蒸馏 进行标签高效视频学习

LEViL: Label-Efficient Video Learning via Zero-Shot Distillation over VLM-Generated Pseudo-Label Spaces

摘要

有监督视频预训练是一种常见的迁移学习实践,用于提高下游动作识别性能。然而,它需要大规模标记的源数据集,并且学习初始化的有效性受到源域和目标域之间的相似性的影响。为不同的目标领域构建此类标记的预训练数据集成本高昂且难以扩展。为了解决这些限制,本研究提出了一种标签高效的视频学习框架,它将无注释视频预训练与目标标签集感知 微调 相结合。在预训练期间,视觉语言模型(VLM)生成未标记视频的文本描述,这些文本描述经过处理以构建可解释的语义伪标签空间。然后,冻结的视频语言模型会在该空间上生成零样本软目标分布,从而允许学生视频编码器学习语义丰富的表示,而无需手动源注释。在下游适应过程中,目标标签集感知 微调 将来自标记目标视频的监督学习与实际目标标签集上的零样本 蒸馏 相结合,有助于保留 VLM 派生的语义指导,同时使预训练编码器适应目标任务。 UCF101 和 HMDB51 上的实验表明,所提出的框架在所有评估的有限标签方案中均优于对比的半监督视频动作识别方法。此外,无注释预训练阶段学习可转移表示,为全数据 微调 提供有效的初始化,尽管依赖于相对适度的未标记预训练池。