论文

音频编解码器稳健攻击 LLM

Codec-Robust Attacks on Audio LLMs

模型评测安全与风险评测

摘要

先前对 Audio 大语言模型 (Audio LLM) 的攻击表明,精心设计的波形域扰动可以强制有针对性的对抗性输出。作为针对这些攻击的防御机制,人们研究了现实世界的编解码器压缩预处理来检测和消除扰动。然而,现有的攻击还没有表现出针对这些压缩的鲁棒性。我们引入了 CodecAttack,它优化神经音频编解码器的连续潜在空间中的扰动,而不是直接扰动音频波形。我们展示了编解码器的压缩通道,它丢弃波形扰动,传输在其自己的潜在空间中精心设计的扰动。为了进一步强化跨现实世界压缩通道的攻击,我们应用多比特率直通期望转换(EoT),所有这些都无需修改目标模型。在三个真实的音频 LLM 部署场景和三个目标模型中,CodecAttack 在 Opus 上以中等比特率实现了平均 85.5% 的目标子串攻击成功率 (ASR),而使用相同的 EoT 强化训练的波形基线在任何比特率下都不超过 26%。攻击转移到保留的编解码器,在 MP3 上达到 100% ASR,在 AAC-LC 上达到 84%,无需重新训练。每频段能量分析显示,潜在扰动集中在 4kHz 以下,正是编解码器分配最多比特的位置,而波形基线则扩展到编解码器丢弃的更高频率。这些结果表明,有损压缩并不是针对对抗性音频的可靠防御,并且编解码器感知攻击对已部署的音频 LLM 系统构成了实际威胁。