论文
DeepFense:用于鲁棒 Deepfake 音频检测的统一、模块化和可扩展框架
DeepFense: A Unified, Modular, and Extensible Framework for Robust Deepfake Audio Detection
摘要
语音深度伪造检测是一个成熟的研究领域,拥有不同的模型、数据集和训练策略。然而,缺乏标准化的实施和评估协议限制了研究的可重复性、基准测试和比较。在这项工作中,我们展示了 DeepFense,这是一个全面的开源 PyTorch 工具包,集成了最新的架构、损失函数和增强管道,以及 100 多个配方。使用 DeepFense,我们对 400 多个模型进行了大规模评估。我们的研究结果表明,虽然精心策划的训练数据可以提高跨域泛化能力,但预训练的前端特征提取器的选择主导了整体性能差异。至关重要的是,我们在音频质量、说话者性别和语言方面的高性能模型中表现出了严重的偏见。 DeepFense 预计将通过必要的工具促进现实世界的部署,以解决公平的训练数据选择和前端 微调 问题。