论文
TAME:用于文本视频检索的时间感知专家组合
TAME: Temporal-Aware Mixture-of-Experts for Text-Video Retrieval
摘要
文本视频检索 (TVR) 检索与自然语言查询匹配的视频,但将 CLIP 等图像文本模型扩展到视频从根本上受到缺乏时间建模的限制。视频在外观和运动方面表现出逐帧异质性,并且将所有帧压缩为单个表示通常会掩盖时间结构和语义转换。为了解决这个问题,我们提出了用于文本视频检索的时间感知专家混合(TAME),这是一个基于 CLIP 的框架,可以联合建模帧级结构和时间关系。首先,我们将稀疏专家混合 (MoE) 层集成到两个 CLIP 编码器中,并在视觉分支上应用帧一致路由,以便专家根据帧级视觉模式进行专业化,同时保留原始视觉语言对齐。其次,我们引入了帧时间(FT)词元,它聚合全局跨帧信息并将其反馈到每个帧,使视觉编码器能够捕获远程时间依赖性而不损害局部细节。第三,我们设计了一个跨时间交互和聚合(CTIA)模块,通过分阶段时间过滤和融合来细化逐帧句子-视频相似性。标准 TVR 基准的实验表明,TAME 持续改进基于 CLIP 的基准。在 MSR-VTT 上,它比 CLIP4Clip 将 R@1 提高了 4.0,并且在 DiDeMo、MSVD、LSMDC 和 ActivityNet 上也实现了一致的增益。该代码可在 https://github.com/sejong-rcv/TAME 获取。