论文

GRM:兼顾正常任务表现的音频大模型越狱攻击评测

GRM: Utility-Aware Jailbreak Attacks on Audio LLMs via Gradient-Ratio Masking

模型评测安全与风险评测

摘要

音频 大语言模型 (ALLM) 支持语音交互,但引入了新的越狱漏洞。现有的基于扰动的越狱没有明确控制哪些频段携带扰动。尽管此类扰动可能会引发不安全的响应,但在不同的输入中重复应用通用扰动也可能会降低正常任务的效用,留下明显的行为足迹,可能会将攻击暴露给用户或自动监控系统,从而损害其隐秘性。为了确定是否需要全频带扰动,我们将覆盖范围从部分频带更改为全频带。越狱成功率 (JSR) 非单调变化,而效用下降随着覆盖范围的增加而增加。这种不匹配表明,与全频带扰动相比,选定的频带可以产生更强的攻击,且效用下降更少。基于这一观察,我们提出了 GRM,一种任务效用感知、频率选择性越狱框架,根据越狱贡献和转录敏感度之间的比率对 Mel 频段进行排名,将普遍扰动限制在选定的频段,并规范与预期请求语义的偏差。对四个 ALLM 的实验表明,GRM 的平均 JSR 达到 88.46%,同时相对于基线大幅减少了良性转录和响应任务的效用下降。我们的代码可在 \href{https://github.com/159753Fetter/GRM}{此存储库} 获取。警告:本文包含潜在敏感内容。