论文
AffectDF:针对情感表达攻击的语音 Deepfake 检测的最全面基准
AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks
摘要
语音深度伪造检测(SDD)系统在传统基准测试中实现了强劲的性能;然而,现有数据集对情感表达和最近基于大型音频语言模型(LALM)的攻击的覆盖范围有限。现有的情感欺骗数据集在规模和攻击多样性方面也受到限制,通常仅涵盖语音转换(VC)或文本到语音(TTS)攻击。我们推出 AffectDF,这是最全面的情感表达语音深度伪造基准,涵盖 TTS、VC、情感 VC 和基于 LALM 的欺骗攻击,涵盖表演和自发情感语音。 AffectDF 包含大约 260 小时的语音,使用 21 次欺骗攻击生成,涵盖五种情绪状态。我们在传统和情感欺骗条件下对最先进的 SDD 系统进行基准测试,包括使用仅推理提示和监督 微调 进行评估的基于 LALM 的检测器。我们的实验表明,当在 AffectDF 上评估在传统基准上训练的模型时,鲁棒性严重下降,其中几个系统的性能接近随机。令人惊讶的是,即使大规模的情感训练也不能持续提高跨域鲁棒性,这表明当前的 SDD 系统无法学习情感和韵律变化下的广义欺骗表征。鲁棒性还因情绪状态、攻击家庭以及行动与自发情绪言语条件的不同而存在很大差异。这些发现暴露了当前 SDD 系统的根本局限性,并将 AffectDF 确立为开发更强大的欺骗检测模型的基准。