论文
基于干预的欺骗对策快捷诊断框架
An Intervention-Based Framework for Shortcut Diagnosis in Spoofing Countermeasures
摘要
虽然 Deepfake 音频检测系统在受控基准测试中实现了高性能,但其可靠性在实际情况下往往会降低。先前的工作表明,数据集特定的工件造成了这一差距。然而,用于识别模型利用哪些声学特性作为捷径的系统工具仍然有限。我们提出了一种基于干预的诊断框架,以有向图形模型为基础,正式区分混淆驱动的快捷方式依赖与合法的域转移。我们通过针对非语音结构、频谱内容和信号能量的受控声学扰动,并辅以语料库级分布分析来实现这一点。通过在 ASVspoof 挑战数据集中使用 RawGAT-ST 评估 XLS-R-300M,我们量化了模型对特定干预类型的敏感性。结果显示,非言语干预产生最大的绩效变化,证实非言语间隔是主要的捷径。