论文
基于幅值专家掩码的混合专家模型深度感知敏感性分析
Depth-Aware Sensitivity Analysis of Mixture-of-Experts Models via Magnitude-Based Expert Masking
摘要
混合专家(MoE)架构通过稀疏激活在保持计算效率的同时扩展大语言模型(LLM)。尽管被广泛采用,单个MoE层的相对重要性仍未被充分刻画,尤其是在模型压缩方面。本文对Qwen3.6-35B-A3B模型(40个MoE层、每层256个专家、top-8路由)在XLCoST跨语言代码翻译基准上使用基于幅值的专家掩码进行了系统的逐层敏感性分析。我们在三台H100 GPU服务器上开展了跨越100、300和500提示评估规模的多阶段研究。核心发现是层敏感性强烈依赖于深度:早期层(0-9)和中间层(10-29)对专家掩码高度脆弱,而晚期层(30-39),尤其是最晚期层(35-39),可以容忍对低幅值专家的激进掩码。在300提示规模下,对所有层统一施加30%掩码只能保留150/300的Good+Similar输出,而聚焦晚期的策略在掩掉640-1,145个专家的情况下可保留249-255/300。在随后500提示的留出验证切片上,窄化的最晚期策略(第35-39层@50%)在受测候选中取得最佳的质量/掩码专家权衡,仅掩掉10,240个总专家中的640个便保留419/500的Good+Similar输出。我们还刻画了将top-k路由宽度从每token 8个活跃专家降到6个的效果:在100提示探针上观察到大幅的实际运行时间下降且无Good+Similar损失,但它尚未能与激进专家掩码良好叠加。这些发现为深度感知的MoE专家掩码提供了实证基础,并为物理权重手术、基于激活的专家评分和训练式恢复建立了可行路径。