论文
DuRe-ST:结合双重谱时关系的语音深伪检测
DuRe-ST: Dual-Relation Spectro-Temporal Modeling for Speech Deepfake Detection
摘要
以前的语音深度伪造检测器可以通过图注意力自适应地捕获频谱-时间依赖性,但它们在很大程度上忽略了频谱和时间表示之间的协变。为了解决这个差距,我们从它们的联合协方差构建了一个归一化的亲和图,并应用多项式图过滤来捕获高阶协方差引起的依赖性。我们首先开发 Cov-ST 来隔离基于协方差的关系模型的贡献。尽管它提高了检测性能,但其对多项式阶次的敏感性表明,当单独对协方差关系建模时,鲁棒性有限。因此,我们提出 DuRe-ST,它联合利用协方差引起和图注意引起的关系来捕获互补的二阶协变和自适应谱时间依赖性。实验表明,DuRe-ST 在 ASVspoof 基准测试中比 XLSR-AASIST 平均相对 EER 降低了 25.9%,在四个跨数据集基准测试中平均相对 EER 降低了 28.4%,仅需要 4-8k 个额外的可训练后端参数。它的性能进一步优于 最强的公开可用比较模型在四个基准上的相对 EER 提高了 2.2-13.2%,同时仍然小于所考虑的公开可用模型。
