论文

音频幻觉攻击:检验音频大模型是否真正依据声音回答

Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models

模型评测安全与风险评测

摘要

大型音频语言模型(LALM)在音频语言任务上表现出色;然而,它们在现实世界中的可靠性仍未得到充分探索。我们引入了音频幻觉攻击 (AHA),这是一个名为 AHA-Eval 的攻击套件,由 6.5K 个 QA 对组成,旨在测试 LALM 是否真正依据音频输入作答。 AHA 针对两个攻击面:(i) 基于查询的攻击,利用问题结构诱发有关不存在声音的幻觉;(ii) 基于音频的攻击,将描述不存在事件的合成语音注入音频流。在评估最先进的 LALM(包括 Audio Flamingo 3 和 Gemini 3 Pro)时,我们观察到攻击成功率分别高达 95.35% 和 79.65%,揭示了标准基准性能所隐藏的可靠性差距。为了缓解这一问题,我们提出了一个 12万条问答的后对齐数据集 AHA-Guard,它成功地将攻击成功率降低了高达 49%。