论文
RASET:与路由器无关的安全关键专家调整暴露了专家混合中的局部安全执行失败 LLM
RASET: Router-Agnostic Safety-Critical Expert Tuning Exposes Localized Safety Enforcement Failures in Mixture-of-Experts LLMs
摘要
专家混合 (MoE) LLM 依赖于稀疏的、路由器驱动的专家激活,但安全对齐如何与路由专家专业化相互作用仍有待探索。一个常见的直觉是,可以通过将有害请求发送给不同的以拒绝为导向的专家来控制安全行为。在这项工作中,我们为不同的情况提供了经验证据:对齐的 MoE LLM 中的路由模式主要是主题驱动的,而安全行为可以在模型的内在路由路径发生微小变化的情况下进行更改。受这一观察的启发,我们提出了 RASET(与路由器无关的安全关键专家调整),这是一个红队框架,用于探测位于一小部分专家中的安全执行,同时保留模型的固有路由行为。 RASET 通过对比路由敏感度标准来识别安全关键专家,并仅对选定的专家应用参数高效调整,从而最大限度地减少与路由器引导干预相关的语义中断。在五个开放权重 MoE 主干网中,RASET 实现了高质量的安全旁路收益率(平均 $ASR_{hq}$ 为 50.5%,比最强基线高出 37.6 个点)。这些结果揭示了教育部明显的安全风险,凸显了专家意识协调机制的必要性。