论文

良性提示与有害提示下Mixtral MoE面向安全的路由分析

Safety-Oriented Routing Analysis of Mixtral MoE Under Benign and Harmful Prompts

模型评测模型架构MoE模型行为与机制分析

摘要

稀疏混合专家(MoE)语言模型对每个Token只激活一小部分参数,这使路由器行为成为模型计算的核心环节。本文利用两种互补信号研究Mixtral 8x7B-Instruct在良性提示与有害提示下的路由行为:源自专家选择频率的基于激活的路由分数,以及源自路由器门控敏感度的基于梯度的分数。我们分析了专家级和层级两个层面的路由行为,并进行了专家抑制干预实验。结果显示,基于激活的专家使用广泛且呈长尾分布,而基于梯度的重要性则较为集中。在专家层面,两类提示组在两种信号下都保持接近,仅有适度分离。在层级层面,基于激活的路由在第8-15层附近最具选择性,而基于梯度的重要性集中在最后几层。专家分类显示,大多数专家在两类提示间共享,但有一小部分专家表现出明显的组别偏好。排名靠前的专家集合在梯度分数下比激活分数下表现出更强的良性—恶意重叠,暗示其集中于一个共用的后层专家集合。在干预实验中,抑制激活分数下前五个良性主导专家,使100条提示中的受限响应从24降至14;而抑制梯度导出的专家则使其从34降至22,且非预期反转更少。总体而言,Mixtral中与安全相关的路由微妙、随深度变化且呈分布式,而非由固定的专家集合主导。

良性提示与有害提示下Mixtral MoE面向安全的路由分析:论文配图
(a) (b) 图1:基于组级激活的专家分析。左:排序的平均激活分数分布。右:累积激活分数分布。有害群体稍微集中一些,但这两个群体总体上仍然大致相似。