论文

FoeGlass:简单的上下文学习足以满足红队音频 Deepfake 探测器的需求

FoeGlass: Simple In-Context Learning Is Enough for Red Teaming Audio Deepfake Detectors

模型评测安全与风险评测

摘要

音频深度伪造检测 (ADD) 模型对于反击文本转语音 (TTS) 模型的恶意使用至关重要。评估和强化 ADD 模型需要开发跨越生成音频空间并突出显示高错误区域的数据集。现有的数据集开发策略面临两个挑战:(i) 手动收集,(ii) ADD 模型中盲点的低效发现。为了应对这些挑战,我们提出了 FoeGlass,这是第一个针对 ADD 的黑盒自动红队方法,它可以有效地发现最先进的 Deepfake 基准测试尚未探索的生成音频空间中的 ADD 故障模式。 FoeGlass 使用 LLM 的上下文学习功能来探索 TTS 模型的输入空间,仅使用对所有组件的黑盒访问即可生成欺骗目标 ADD 的音频样本。通过使用基于多样性测量的精心设计的上下文,FoeGlass 缓解了自动化红队系统中模式崩溃的常见问题。对多个开源 ADD 和 TTS 模型的实证评估表明,与无条件采样基线和最近的欺骗数据集相比,FoeGlass 生成的数据大大提高了假阴性率高达 94%,同时无需人工监督。此外,我们还表明 FoeGlass 生成的攻击可以在不同的目标 ADD 之间转移,这证明了其对于 ADD 系统的自动红队的广泛适用性和易用性。最后,FoeGlass 生成的样本上的 微调 ADD 模型显着增强了探测器的鲁棒性(提高了 41%)。