论文

SpeechJBB:探讨代码转换语音下大型音频语言模型的安全对齐和理解

SpeechJBB: Probing Safety Alignment and Comprehension in Large Audio Language Models under Code-Switched Speech

模型评测安全与风险评测

摘要

大型音频语言模型 (LALM) 越来越多地部署在现实世界的应用中,但其安全性仍然主要根据单语言、基于文本的有害提示进行评估。这使得它们在多语言和口语环境下的普遍性,特别是语码转换语音,在很大程度上尚未得到充分探索。为了解决这一差距,我们引入了 SpeechJBB,这是一个音频越狱数据集,用于对五种欧洲语言的最先进的 LALM 进行基准测试:英语、法语、德语、意大利语和西班牙语,以及组合这些语言的代码转换变体。通过引入增强设置,在安全关键术语周围插入语音上合理的伪词来模拟局部混淆,进一步探讨安全弱点的程度。在各个模型中,代码转换的有害音频产生相当高的越狱成功率 (JSR),其中非英语单语和非英语代码转换对表现出最高的攻击成功率。随着插入密度的增加,伪词插入单调地减少拒绝,尽管模型很少将有害含义归因于插入的标记。理解基准表明,这些失败不能归结为多语言误解,因为一些具有强大 ASR、口语理解和口语推理性能的模型是最容易受到攻击的。