论文
音频中韵律驱动的越狱 LLM:受控研究和机制分析
Prosody-driven Jailbreaks in Audio LLMs: A Controlled Study and Mechanistic Analysis
摘要
支持音频的基础模型可以实现端到端的语音交互,但它们也带来了转录内容之外的安全风险。目前尚不清楚语音传递中的匹配文本变化能产生多大的越狱能力,而不是词汇重写或更广泛的风格转换。我们通过保持文本内容固定并改变六个其声学属性可能共同变化的语音传递预设来研究这个问题。我们推出了 PJ-Break,这是一种黑盒评估协议,具有针对唤醒、权威和语速的预设,以及 AdvAudio-Prosody,这是一个具有声学验证属性的 600 个样本基准。在精确的 QC 后 Qwen2-Audio 面板上,Q=1 Panic (38/95)、Anger (35/95) 和 Fast (32/95) 预设均远高于 Neutral (4/95)。固定的六查询池涵盖 44/95 Qwen2-Audio 种子和 15/95 GPT-4o 种子,并超过 Qwen2-Audio 上匹配预算的 StyleBreak 重新实现 (27/95)。排除混杂的指挥条件的相同语音池仍然达到 40/95,并且保留面板消融显示单独的情感传递音频 (44/95) 比单独的情感文本 (11/95) 更有效。探索性替代诊断和试点缓解观察是次要的非核心分析。总体而言,匹配文本语音传输应被视为音频 LLM 安全评估中的首要因素