论文

范围越广越好吗?用于语音 Deepfake 检测的 Frozen SSL 编码器中多语言覆盖和预训练目标的对照研究

Is Broader Better? A Controlled Study of Multilingual Coverage and Pretraining Objective in Frozen SSL Encoders for Speech Deepfake Detection

模型评测鲁棒性、公平性与可信度评测

摘要

Frozen 自监督 (SSL) 语音编码器是用于音频深度伪造检测的强大、低成本前端,最近的比较表明大型、多语言、有判别性的编码器在域外具有最佳的泛化能力。这些比较无法同时控制编码器容量、预训练目标和多语言覆盖范围,无法确定哪个编码器获胜而无法隔离原因。我们提出了一种具有固定管道和可训练容量的受控分解。我们改变了四个 wav2vec2 系列编码器的多语言覆盖范围,与约 315M 参数相匹配。我们将预训练目标隔离在两个匹配相同数据的编码器上。覆盖范围无济于事,因为域外错误在约 100 种语言规模 (XLS-R) 下急剧下降,但在 1406 种语言极限 (MMS) 上没有进一步改善。我们发现,中等覆盖编码器在更远的域外集上最强,在 315M 时匹配或超过 577M 参数模型。它在这些远集上领先,在配对引导下具有统计显着性,并且在官方 ASVspoof 5 成本指标上在两个后端下保持领先。另外,在相同数据上,掩模预测预训练的泛化能力优于对比(In-the-Wild EER 26.5% vs. 46.8%)。在这个固定的冻结编码器配方中,我们发现更广泛和更大的模型并不可靠更好。