论文

槲寄生:对 推测解码 的隐形加速崩溃攻击

Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding

模型评测安全与风险评测

摘要

推测解码 已成为一种广泛采用的技术,通过起草多个候选标记并使用目标模型并行验证它们来加速 大语言模型 (LLM) 推理。然而,它的效率主要取决于平均接受长度$τ$,即每个验证步骤中有多少草稿词元幸存下来。在这项工作中,我们在基于模型的 推测解码 中发现了一个新的机制级漏洞:起草者经过训练以近似目标模型分布,但这种近似不可避免地是不完美的。这种起草者与目标的不匹配会创建一个隐藏的攻击面,其中小的扰动可以保留目标模型的可见行为,同时大大降低起草词元的可接受性。我们提出 Mistletoe,一种针对 推测解码 的隐形加速崩溃攻击。 Mistletoe直接针对推测解码的接受机制。它联合优化了降低起草者与目标一致性的降级目标和约束目标模型输出分布的语义保留目标。为了解决这些目标之间的冲突,我们引入了零空间投影机制,其中退化梯度被投影远离局部语义保留方向,抑制草稿接受,同时最小化语义漂移。在各种 推测解码 系统上进行的实验表明,Mistletoe 显着降低了平均接受长度 $τ$,破坏了加速,并降低了平均词元吞吐量,同时保持了输出质量和困惑度。我们的工作强调,推测解码 引入了超越现有输出鲁棒性的机制级攻击面,需要更鲁棒的 LLM 加速系统设计。