论文

将自监督语音模型转为MoE以改善伪造检测

From Self-Supervised Speech Models to Mixture-of-Experts for Robust Anti-Spoofing

摘要

语音生成领域的最新进展显着提高了合成语音的自然度,使得欺骗检测变得越来越具有挑战性。当前反欺骗系统的一个关键限制是它们对看不见的合成方法的鲁棒性有限。在这项工作中,我们将自监督语音表示模型转变为专家混合(MoE)架构以提高泛化能力。选定编码器层中的前馈块被由分层门控机制控制的多个专家网络取代,允许专家捕获互补的声学模式,同时保留在自监督预训练期间学到的表示。我们进一步分析影响此 MoE 转换性能的架构选择,并研究专家的激活行为。所提出的方法在 14 个欺骗数据集上进行了评估,并将宏观 EER 从 5.46% 降低到 4.81%,相当于等错误率相对下降11.9%。