论文

频率不是敏感度:稀疏MoE中安全敏感专家的识别

Frequency Is Not Sensitivity Identifying Safety-Sensitive Experts in Sparse MoE LLM

模型评测模型架构MoE模型行为与机制分析

摘要

抑制一小部分被路由的专家可以在不重训的情况下削弱稀疏MoE语言模型的安全行为。抑制哪些专家因此是安全问题;惯常答案是激活频率,但频率度量的是使用而非影响。我们检验替代方案:路由器梯度敏感度——序列损失对选择专家的门控权重的敏感度。跨五个MoE架构,我们在500良性与500恶意提示上按两种信号对专家排序,并在两个预算(相同专家数与相同名义恶意路由流量1%-5%)下测量100个留出恶意提示上的拒绝率。两种预算下,路由器梯度选择在25个条件中的24个比激活更大幅度降低拒绝,且在全部25个中超过十次试验随机均值。最大效应出现在OLMoE:拒绝从34/100降至9/100(相对73.53%)且无退化输出,表明是实质性顺从而非生成损坏。在每层匹配专家数后,梯度选择仍在25个条件中的23个产生更大拒绝削减(两平局)。探索性跨模型分析把更大的恶意-良性集中差距与更大的峰值梯度效应联系起来(rho=0.90;精确双侧p=0.083,n=5)。结果支持在受测预算下使用梯度选择。