论文

MoEMB:利用高效的专家混合模型扩展通用多模态嵌入

MoEMB: Scaling Universal Multimodal Embeddings with Efficient Mixture-of-Experts Models

摘要

通用多模态嵌入 (UME) 对编码器处理各种任务和模态的能力提出了越来越高的要求,而且复杂性也不断增加。先前的缩放方法要么增加表示大小、检索工作量,要么将编码器缩放为重型多模态 LLM。最近的工作,例如 Think-Then-Embed (TTE),探索通过推理词元进行扩展。然而,嵌入模型很难扩展:增加参数直接权衡对比学习所需的大训练批量大小,并且必须在严格的延迟下提供检索服务。此外,UME 任务的复杂性各不相同,扩大嵌入器可能会带来大量的冗余计算。在这项工作中,我们提出了 MOEMB,它通过专家混合 (MoE) 沿着专家轴缩放 UME,在保留单向量、非自回归编码的同时增加编码器容量。通过对基于 MoE 的 UME 的设计空间和训练方案进行系统研究,MoEMB 在公共 MMEB 系列数据训练的模型中为 MMEB-V2 和 MRMR 设定了新的技术水平:MoEMB 仅使用 3B 个活动参数,就超越了基于 TTE 的方法,其活动参数超过 4 倍,并且使用的计算量显着减少。为了进一步提高可扩展性和效率,我们首次对基于 MoE 的嵌入的自适应计算进行了全面研究,涵盖基于训练和仅推理方法的多种策略。总之,这些结果支持专家扩展作为 UME 的有效和高效方向,自适应计算进一步提高了基于 MLLM 的嵌入模型向大规模检索和推荐系统的效率。