论文
Echoes:语义对齐的音乐深度伪造检测数据集
Echoes: A semantically-aligned music deepfake detection dataset
摘要
我们推出了 Echoes,这是一个用于音乐深度伪造检测的新数据集,专为在现实和提供商多样化的条件下训练和基准测试检测器而设计。 Echoes 包含 4,468 首曲目(131 小时的音频),涵盖多种流派(流行、摇滚、电子),并包括由十种流行的人工智能音乐生成系统生成的内容。为了防止捷径学习并促进稳健的泛化,数据集被故意构建为具有挑战性,强制欺骗音频和真实参考之间的语义级别对齐。这种对齐是通过直接在真实波形或歌曲描述符上调节生成的音频样本来实现的。我们使用最先进的 Wav2Vec2 XLS-R 2B 表示形式,针对三个现有的 AI 生成的音乐数据集,在跨数据集设置中评估 Echoes。结果表明 (i) Echoes 是最难的域内数据集; (ii) 在现有数据集上训练的检测器向 Echoes 的传输效果不佳; (iii) Echoes 训练产生最强的泛化性能。这些发现表明,提供者多样性和语义对齐有助于学习更多可转移的检测线索。