论文
监督语音基础模型 后训练,用于语音 Deepfake 检测中的鲁棒自适应
Supervised Post-training of Speech Foundation Models for Robust Adaptation in Speech Deepfake Detection
摘要
大型语音基础模型已显示出语音深度伪造检测的强大潜力,但直接 微调 受到自监督 预训练 目标与欺骗特定工件之间不匹配的限制。为了解决这个问题,我们提出了一种混合帧 后训练 策略来创建局部欺骗导向的扰动,并使用帧级监督来鼓励 SSL 模型学习对于稳健的欺骗检测至关重要的局部不一致。在 ASVspoof5 上,我们在没有数据增强的情况下,单个模型实现了最先进的 EER 4.50%。在 ASVspoof2021 LA/DF 上,LA 和 DF 之间的绝对 EER 差距仅为 0.16%,这表明在不同的失真条件下具有强大且平衡的鲁棒性。这些结果表明,有监督的 后训练 提供了一种有效且实用的方法来调整语音基础模型以实现稳健的深度伪造检测。