论文

AEGIS:通过内部信号进行音频内源防护,防止大型音频语言模型越狱

AEGIS: Audio Endogenous Guarding via Internal Signals Against Large Audio-Language Model Jailbreaks

模型训练监督微调与指令调优

摘要

大型音频语言模型 (LALM) 扩展了语言模型来处理和解释音频,但也使它们面临异构音频越狱的风险。我们询问成功的越狱是否反映了未能识别有害意图或在识别后发生的错误。逐层探测揭示了后者:风险相关信息仍然可以从中间表示中解码,但内部风险信号无法转化为稍后层处理中的拒绝。我们将这种差异称为风险与拒绝差距。基于这一发现,我们提出了 AEGIS,一种先检测后干预的防御方法,其中层风险门有选择地激活下游安全适配器。在六个 LALM 和三个异构音频越狱基准测试中,AEGIS 将平均不安全率从 17.9% 降低到 0.4%,同时仅导致良性输入的过度拒绝略有增加。这些结果表明,选择性内部干预是 LALM 中实现更强有力拒绝的有效途径。该代码可从此 https URL 获取。