论文
土拨鼠位翻转攻击:通过位翻转在专家混合 LLM 中播种无限生成循环
Groundhog Bit-Flip Attack: Seeding Infinite Generation Loops in Mixture-of-Experts LLMs through Bit Flips
摘要
专家混合 (MoE) 架构通过路由机制有选择地激活专家子网络,从而实现可扩展且高效的 大语言模型 (LLM)。然而,这种自适应设计引入了一个新的攻击面:特定专家与某些标记(例如序列末尾)不成比例地相关,从而允许对手通过轻量级扰动来操纵模型行为。在这项工作中,我们提出了 \textbf{Groundhog 位翻转攻击(GBFA)},这是针对基于 MoE 的 LLM 的第一个基于位翻转的 \textit{ 拒绝钱包可用性攻击}。通过识别和翻转与相关专家激活相关的路由层位,我们证明 GBFA 极大地扩展了三种不同 LLM 模式的解码词元使用:会话、推理和代理任务,同时在很大程度上保留了语义保真度。在四个主要的现实世界中基于 MoE 的 LLM 中,手动停用平均少于 \textbf{4 位专家} 会将平均输出通胀推至 $\mathbf{5912\%}$,并且大多数测试样本达到最大词元数。这些结果揭示了 MoE 架构对位翻转的鲁棒性漏洞,并强调了 GBFA 作为针对 LLM 的可用性攻击的潜力。