论文

MACS:模态感知容量扩展,实现高效的多模态 MoE 推理

MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference

模型推理批处理与并行

摘要

由于散乱者效应,专家混合多模态 大语言模型 (MoE MLLM) 在专家并行 (EP) 推理过程中遇到了严重的效率瓶颈。这个问题在多模态环境中变得更加严重,因为现有的基于词元计数的负载平衡方法无法解决两个独特的挑战:(1)信息异质性,其中大量冗余的视觉词元与语义上关键的词元被同等对待,以及(2)模态动态,其中跨任务不同的视觉与文本比率导致资源分配不当。为了应对这些挑战,我们提出了 MACS(模态感知容量扩展),这是一个 无需训练 推理框架。具体来说,MACS引入了熵权负载机制来量化视觉标记的语义价值,解决信息异构性。此外,动态模态自适应能力机制根据输入的实时模态组成来分配专家资源。大量实验表明,MACS 在各种多模态基准上显着优于现有方法,为在 EP 推理中有效部署 MoE MLLM 提供了新颖且强大的解决方案。