论文
使用深度学习框架的环境声音 Deepfake 检测
Environmental Sound Deepfake Detection Using Deep-Learning Framework
摘要
在本文中,我们提出了一种用于环境声音 Deepfake 检测(ESDD)的深度学习框架 - 识别输入音频记录中的声音场景和声音事件是假的还是真实的任务。为此,我们首先进行广泛的实验,探索单个频谱图、各种网络架构和预训练模型如何影响 ESDD 模型的性能。 EnvSDD 基准数据集上的实验结果表明,检测声音场景的 Deepfake 音频和检测声音事件的 Deepfake 音频应被视为单独的任务。我们还表明,微调 预训练模型比从头开始训练 ESDD 模型更有效。最终,我们的最佳模型使用所提出的两阶段训练策略对预训练的 BEAT 模型进行了微调,在 EnvSDD 数据集的测试子集上实现了 0.98 的准确度、0.95 的 F1 分数和 0.99 的 AUC 分数。在 ESD-Challenge-TestSet 数据集上进行跨数据集评估时,我们的最佳模型还实现了 0.86 的准确度、0.80 的 F1 分数和 0.93 的 AUC 。