论文

VisMMOE:利用视觉专家亲和力实现高效的视觉语言 MoE 卸载

VisMMOE: Exploiting Visual-Expert Affinity for Efficient Visual-Language MoE Offloading

AI 基础设施推理服务

摘要

大规模视觉语言专家混合(VL-MoE)模型提供了强大的多模态能力,但在内存受限的平台上高效部署仍然很困难。现有的 MoE 卸载系统主要是为以文本为中心的工作负载而设计的,对于视觉密集型输入的效率要低得多,因为大量视觉标记会导致更广泛且难以预测的专家访问。我们提出了 VisMMoE,一个基于单一系统洞察构建的 VL-MoE 卸载系统:修剪冗余视觉标记不仅可以通过减少计算,还可以通过重塑专家需求来改善卸载。我们将这种效果称为 \textit{视觉专家亲和力}:词元修剪使专家访问在层内更加集中,跨层更加稳定,从而产生更小且更可预测的专家工作集。在这一见解的指导下,VisMMoE 结合了亲和力感知词元压缩、前瞻专家预测和缓存/管道编排,以在内存预算紧张的情况下提高专家局部性和预取效率。我们在多个框架上实现 VisMMoE,并在代表性的 VL-MoE 模型和基准上对其进行评估。与当今 VL-MoE 部署的强大基准相比,VisMMoE 将端到端推理性能分别提高了 2.68 倍和 1.61 倍,同时保持了有竞争力的准确性。