论文

DecoMoE:解耦视觉传播和专家计算以实现高效的多模态 MoE 推理

DecoMoE: Decoupling Visual Propagation and Expert Computation for Efficient Multimodal MoE Inference

摘要

多模态专家混合 (MoE) 模型将稀疏专家激活与视觉语言功能相结合,但其推理成本仍然很高,因为长视觉词元序列反复引起注意、路由、调度和专家 MLP 计算。现有方法通常会压缩词元或专家维度,而在另一个维度上留下冗余。我们的分析揭示了两个互补的规律:视觉传播所需的深度因输入而异,而文本标记路由则表现出集中且反复出现的专家重要性模式。基于这些观察,我们提出了 DecoMoE,一种二维结构化压缩框架,可将视觉传播与专家计算解耦。样本自适应视觉边界(SAVB)预测依赖于输入的视觉出口层,在该层处视觉词元块被移除。路由校准专家前缀 (RCEP) 使用文本标记路由质量对专家进行离线重新排序,并且从该预测的退出层开始,在每个 MoE 层保留覆盖目标路由质量分数的最短连续前缀。我们在 Qwen3-VL-MoE 和 InternVL3.5-30B-A3B 上通过六个基准评估了 DecoMoE。在 Qwen3-VL-MoE 上,DecoMoE 保留了 97.91% 的密集基线性能,同时将计算量从 27.06 TFLOP 减少到 16.73 TFLOP,将延迟从 0.44 秒减少到 0.26 秒,从而实现了 1.69 倍的加速。代码可在 https://github.com/ShawnTan86/DecoMoE. 获取