论文
ARENA:大型音频语言模型的自动红队
ARENA: Automated Red-Teaming for Large Audio Language Models
摘要
大型音频语言模型 (LALM) 使得通过语音、音乐和环境声音与语言模型进行交互成为可能,但它们也引入了一个安全表面,该安全表面很难通过纯文本红队暴露。我们研究基于音频的自动化红队,其中文本查询必须保持隔离安全,而联合文本音频输入会引发有害的目标行为。我们提出了 ARENA,这是一个闭环框架,可在独立的 2,000 例文本音频数据集上训练控制器。 MD-Judge 提供训练奖励和自适应搜索反馈,而单独的非自适应 Llama Guard 3 评估器则单独标记最终结果。在 520 个 AdvBench 目标上,ARENA 在 Audio Flamingo 3、Qwen2-Audio、MiMo-Audio 和 GPTAudio 上分别实现了 87.9/100.0%、71.5/96.3%、68.1/100.0% 和 75.4/98.5% 的 FDR/PSR。消融表明,基于反馈的细化和音频变体搜索极大地改善了攻击发现。