论文
MoE-ViE:用于高效图像和视频理解的专家视觉编码器混合
MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video Understanding
摘要
视觉编码器是视觉语言模型的关键组件,扩展其容量可以有效提高性能。然而,密集扩展会增加计算成本和推理延迟。专家混合 (MoE) 架构提供了一种引人注目的替代方案,在 LLM 中实现了高效扩展,但 CLIP 式视觉编码器的 MoE 设计空间在最先进 (SOTA) 水平上仍未得到充分探索。在这项工作中,我们系统地研究了用于视觉编码器缩放的 MoE 设计,并发现细粒度 MoE 拓扑比密集和标准 MoE 拓扑产生了显着的增益。我们进一步提出了一种辅助无损平衡变体,以更好地利用专家,并设计一个专门的 MoE 内核来减轻推理延迟开销。为了在保留图像知识的同时增强视频功能,我们引入了帧级 蒸馏 以及新颖的冻结机制。我们预训练了一系列不同尺寸的专家混合视觉编码器 (MoE-ViE),所有这些编码器的性能始终优于密集型编码器。我们最大的模型与 1.7 倍大小的 SOTA 编码器的零样本性能相匹配,延迟仅为 76%。当与 LLM 配合使用时,MoE-ViE 在图像和视频基准测试中超越了所有比较的编码器,包括那些激活参数高达 5 倍的编码器。代码可在 https://github.com/facebookresearch/moe_vie 获取。