论文

VidPrism:图像到视频传输专家的异构组合

VidPrism: Heterogeneous Mixture of Experts for Image-to-Video Transfer

摘要

随着 预训练 技术的快速发展,采用大规模视觉语言模型(VLM)进行视频理解\emph{\ie}图像到视频的迁移学习已成为主导范例。为了实现卓越的性能,在最新进展中,采用专家混合 (MoE) 来增强 VLM 的时间建模能力是一种有效的策略。然而,传统的 MoE 设计面临专家同质化的问题,所有专家都充当相同的通才,从无差别的视频流中学习时空特征的效率低下。为了克服这个问题,我们提出了 VidPrism,一种新颖的异构时间专家混合框架。 VidPrism 通过部署功能专业的专家开创了劳动分工,每个专家都承担从空间理解到时间建模的角色。为了适当地满足这些专家的需求,我们引入了一个内容感知的多速率采样模块,该模块动态生成从丰富语义到以运动为中心的表示的流,为专家提供专门的输入。此外,动态的双向融合机制可以实现这些路径之间的协同信息交换,从而实现全面的视频表示。对各种视频识别基准的大量实验表明,VidPrism 实现了最先进的性能,并有效地促进了专家的专业化。我们的源代码位于 \href{https://github.com/Lrrrr549/VidPrism.git}{https://github.com/Lrrrr549/VidPrism.git}。