论文
RouteHijack:针对混合专家的路由感知攻击 LLM
RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs
摘要
安全对准对于负责任地部署 大语言模型 (LLM) 至关重要。随着专家混合 (MoE) 架构越来越多地用于扩展模型容量,了解其安全稳健性变得至关重要。然而,现有的对抗性攻击有明显的局限性。基于提示的越狱对启发式搜索和传输的依赖很差,模型干预方法需要对内部表示的特权访问,而基于优化的输入攻击仍然以输出为中心,并且由于不可微分的路由机制而从根本上仅限于 MoE 模型。在本文中,我们介绍了 RouteHijack,这是 MoE LLM 的路由感知越狱。我们的主要见解是,安全行为集中在一小部分专家身上,从而创造了通过输入优化影响路由决策来引导模型行为的机会。基于这一观察,RouteHijack 首先执行响应驱动的专家本地化,通过对比安全拒绝和有害完成下的激活来识别安全关键和有害专家。然后,它构建具有路由感知目标的对抗性后缀,抑制安全专家,提升有害专家,并防止生成过程中的早期拒绝。在推理时,优化后的后缀会附加到恶意提示中,仅需要输入访问。在七个 MoE LLM 中,RouteHijack 实现了 69.3% 的平均攻击成功率 (ASR),比之前基于优化的攻击高出 3.2 倍。 RouteHijack 还在五个兄弟 MoE 变体之间传输零样本,将平均 ASR 从 27.7% 提高到 61.2%,并进一步推广到三个基于 MoE 的 VLM,将平均 ASR 从 2.47% 提高到 38.7%。这些发现暴露了稀疏专家架构中的一个根本漏洞,并强调了对输出级对齐之外的防御的需求。