论文

从听不见的输入到模型故障:LALM 中的低频安全风险

From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

模型评测安全与风险评测

摘要

大型音频语言模型(LALM)在理解不同音频输入方面表现出了强大的能力。这种多样性包括人类听不见但仍然可以进入模型并影响其生成的低频信号。然而,这种低频输入对 LALM 的实际影响在很大程度上仍未得到探索。在本文中,我们提出了间歇性低频锁定(ILL),这是一种听不见的红队方法,可在黑盒设置中使用通用波形模板来评估这种风险。 ILL 使用句子注意力量表估计来确定活动间隔,并使用频率混淆转移根据语料库频谱变化构建具有连续相位的低频波形。为了减轻这种风险,我们提出分布式重新查询防护(DRG)来检测低频分布变化,并有条件地请求第二次记录以进行语义恢复。在 6 个 LALM 和多个音频理解任务中,ILL 的准确度降低了高达 67 个百分点,同时人类平均听觉等级为 1.33,接近干净音频的 1.17;干净利落的重新捕获后,DRG 将平均攻击准确度从 28.5% 提高到 46.1%。这些发现确定了 LALM 之前被忽视的安全风险,并为未来强大的音频理解研究奠定了基础。