论文

MoVA:学习非对称双投影以实现模块化长视频文本对齐

MoVA: Learning Asymmetric Dual Projections for Modular Long Video-Text Alignment

模型训练预训练

摘要

对比 预训练 推动了视频文本对齐,但模型通常继承了 CLIP 等图像文本前身的关键局限性,导致了纠缠表示。视频领域的两个基本属性严重加剧了这些挑战:时间错位,其中文本描述通常仅与特定的、受限的时间窗口相关,而其他帧与文本无关;语义不对称,它规定了帧级视觉细节和视频描述级概念之间的稀疏、双向和非对等的相关性。无论视频描述较短且在时间上不相交,从而产生歧义,还是较长且详细,会加剧静态对象与其时间演变之间的纠缠,这种失败都会持续存在。在本文中,我们建立了理论条件,可以在时间维度和不同粒度级别上实现视频和文本表示之间的灵活对齐。基于这些理论见解,我们引入了 MoVA(模块化长视频文本对齐),它学习双重不对称投影:自适应选择视频描述的帧感知子空间的文本侧投影,以及解开与文本相关的视觉概念的视频侧投影。我们的框架确保模型可以保留全局跨模式语义,同时解开不断发展的特定于框架的概念,并自然地扩展到长视频描述和视频。实证评估表明,MoVA 在多个视频文本对齐任务中优于现有方法,证明了我们方法的有效性。