论文

海豹突击队:通过共享专家协调来加强专家混合的全球安全

SEAL: Reinforcing Global Safety in Mixture-of-Experts through Shared Expert ALignment

模型训练参数高效训练

摘要

Mixture-of-Experts (MoE) 是 大语言模型 的扩展架构,每个词元仅激活一小部分专家模块,从而通过近乎恒定的计算实现大规模参数增长。最近的混合 MoE 架构增加了共享专家来捕获一致有用的表示,进一步提高稳定性和泛化性。 MoE 现在为许多旗舰开源和商业模型提供支持,但仍然容易受到对抗性攻击。具体来说,稀疏路由引入了一个结构性漏洞:MoE 安全取决于激活专家,而对手可以通过越狱提示、恶意 微调 和安全关键神经元的权重级别修剪来颠覆这种选择。现有的防御主要集中在强化路由器,但由于路由过程的不确定性,对手仍然可能操纵或绕过路由轨迹,从而崩溃防御。为了解决这个问题,我们首先从理论上和经验上确定共享专家,一个包含一小部分安全关键神经元的始终激活的组件,可以克服稀疏激活的路由路径的不确定性,并作为独立于路由器的锚来增强全局安全对齐。基于这一见解,我们提出了 SEAL,一种训练时参数高效的防御,可生成连接到共享专家的即插即用适配器,以及 SEAL++,一种在训练期间添加正交约束以保留预先存在的安全子空间的变体。我们在六种攻击场景中评估 SEAL 和 SEAL++,这些攻击场景结合了三种对抗性输入(有害提示、越狱、恶意 微调),有或没有神经元修剪。 SEAL 将攻击成功率 (ASR) 降低了高达 60%,而五个基准平均值的能力成本最多为 1.4%。此外,SEAL还可以与路由器级防御无缝集成,以实现更强大的防御。在此设置下,我们可以将ASR进一步降低至4.8%,比单独的路由器级防御低五倍以上。更广泛地说,我们的工作表明,共享专家构成了先前工作所忽视的独特防御表面,提供了补充的安全调整途径。