论文

CRAF:用于 Deepfake 语音检测的跨视图残差感知融合

CRAF: Cross-View Residual-Aware Fusion for Deepfake Speech Detection

AI 基础设施AI安全与内容治理基础设施

摘要

语音合成和语音转换方面的最新进展使深度伪造语音变得越来越真实,从而使看不见的欺骗攻击的泛化成为一项严峻的挑战。预训练的语音和音频模型为提高此类看不见的攻击的鲁棒性提供了一个有前途的方向。自监督学习 (SSL) 模型捕获细粒度的低级声学特征,而听觉大语言模型 (ALLM) 提供更高级别的上下文表示。这些互补的观点可以为提高对未见攻击的泛化能力提供有用的线索。然而,直接融合并没有明确地将两个视图之间共享的信息与视图特定的互补信息分开,从而限制了有效的跨视图集成。为了解决这个问题,我们提出了 CRAF,一种跨视图残差感知融合框架,它使用 ALLM 引导的跨视图注意力来丰富 SSL 表示,并采用 ALLM 作为高级参考,将 ALLM 可解释信息与补充 SSL 残差信息分开。残差通过自适应门控进行选择性细化,并通过 SSL-primary fusion 进行集成。 ASVspoof 5 上的实验表明,采用 Kimi-Audio 的 CRAF 实现了 5.96% 的 EER 和 0.1192 的 minDCF,证明了对看不见的欺骗攻击的鲁棒性。