论文
分解混合专家模型中的拒绝转向
Decomposing Refusal Steering in Mixture-of-Experts Models
摘要
指令调整的 大语言模型 (LLM) 中的安全对齐取决于模型可靠地拒绝有害或不允许的请求的能力。最近的工作表明,在推理过程中可以将引导向量应用于密集的 LLM,以抑制拒绝行为并诱导对有害请求的响应。我们将这种拒绝引导方法扩展到三个开源专家混合 (MoE) LLM,以分解并更好地理解拒绝机制如何跨 MoE 组件运行。我们发现,转向性能不受 MoE 架构固有的复杂路由模式的影响,并且当可以自由选择自己的位置时,单个专家平均可以恢复 78% 的完全转向效果。然而,当受限于全层转向使用的位置时,专家级转向平均只能恢复 54%,在安全相关系统提示下,这一差距进一步扩大。我们的结果还表明,这些转向方法捕获的拒绝信号与专家路由行为捕获的拒绝信号不同。总之,这些结果表明拒绝行为在 MoE LLM 架构中分布不均匀,而不是由单一统一机制控制。