论文
用于高效视频语言预训练的集群时空掩蔽
Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining
摘要
大规模视频语言预训练可以实现跨多模式任务的强大泛化,但通常会产生高昂的计算成本。尽管屏蔽视觉建模的最新进展有助于缓解这个问题,但它们仍然面临两个基本限制:高屏蔽率下严重的视觉信息丢失和帧间相关性引起的时间信息泄漏。为了应对这些挑战,我们提出了 ClusterSTM,一种用于高效视频语言预训练的 Cluster-Wise Spatio-Temporal Masking 策略。 ClusterSTM 首先执行帧内聚类,将视觉标记划分为多个语义独立的簇,然后通过保留每个簇内时间密度最高的标记来进行簇式掩码。我们的掩蔽策略确保保留的标记捕获整体视频内容,同时表现出很强的时间相关性。此外,我们引入了视频文本相关性重建目标,该目标将高级多模态语义调整到传统视觉重建之外。跨多个基准的大量实验表明,ClusterSTM 在视频文本检索、视频问答和视频字幕任务上实现了卓越的性能,在高效的视频语言模型中建立了新的最先进技术。