论文
针对大型音频语言模型的成员推理攻击
Membership Inference Attacks against Large Audio Language Models
摘要
我们首次对 LALM 进行系统的成员推理攻击 (MIA) 评估。使用基于文本、频谱和韵律特征的多模态盲基线,我们证明即使没有模型推理,常见的音频数据集也表现出近乎完美的训练/测试可分离性(AUC ~ 1.0),因此 MIA 可以主要检测分布偏移。因此,我们引入了盲基线协议来控制这种混淆。在此协议下,我们发现分布匹配的数据集可以实现可靠的 MIA 评估,而无需分布偏移伪影。我们对多种 MIA 方法进行基准测试,并对这些数据集进行模态解缠实验。结果表明,LALM 记忆是跨模式的,仅通过将说话者的声音身份与其文本结合起来而产生。这些发现为审计 LALM 建立了超越虚假相关性的原则标准。我们的代码库位于 https://github.com/snooow1029/ALM_MIA。