论文
永不停止说话:对端到端语音语言模型的拒绝服务攻击
Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models
摘要
许多研究表明,特制的输入会导致 大语言模型 (LLM) 生成过长的输出,从而导致大量的计算开销和资源消耗。虽然大多数现有的拒绝服务 (DoS) 攻击仅针对纯文本 LLM,但端到端 (E2E) 语音 LLM 正在迅速出现。现有的基于文本的 DoS 攻击主要依赖于即时工程,例如对抗性后缀或语义诱导,这些攻击利用了文本输入的离散特性,因此无法直接转换为连续语音输入。此外,先前对语音模型安全性的研究主要集中在ASR或TTS系统上,而E2E语音LLM的DoS漏洞很大程度上未被开发。为了弥补这一差距,我们提出了针对 E2E 语音模型的基于扰动的 DoS 攻击。我们的方法不是通过即时操作来诱导长输出,而是优化难以察觉的声学扰动,以直接影响模型的自回归生成过程,同时保留原始输入长度。具体来说,我们将该攻击制定为复合优化目标,通过集成加权 EOS 损失、top-k logits 损失、长度损失和语义对齐损失来共同抑制 EOS 生成、鼓励延长解码时间并在很大程度上保持语义一致性。为了进一步提高隐蔽性,我们采用语音活动检测(VAD)仅将扰动注入有声区域。对三个开源 E2E 语音 LLM 的大量实验表明,我们的方法实现了稳定的攻击成功率,同时显着增加了生成长度和 GPU 资源消耗,揭示了现代 ALLM 中的安全风险。