论文
大型音频语言模型中的音频越狱:分类、攻击防御分析和成本感知评估
Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
摘要
大型音频语言模型 (LALM) 将越狱风险从 词元级 提示扩展到完整的语音感知到推理管道,其中可以通过语义、声学风格、信号伪影或内部表示来诱发不安全行为。现有的工作在异构威胁模型和评估协议下研究这些风险,因此很难比较攻击实用性或防御实用性。本文提供了 LALM 越狱攻击和防御的统一分类法和受控实证评估。我们将之前的工作分为语义、声学、信号和嵌入层攻击;基于守卫、无需训练 和基于训练的防御;以及跨模式、音频原生和交互式基准。然后,我们评估十个开源 LALM 的代表性攻击和防御,不仅测量攻击成功率,还测量良性拒绝和延迟。我们的结果表明,声学 Best-of-N 揭示了最坏情况下的音频空间漏洞,叙事框架是一种有效的低延迟语义威胁,而当前的防御措施以稳健性与良性可用性为代价。这些发现支持成本和效用意识评估,作为对仅成功率的 LALM 安全基准的必要补充。