论文

AT-ADD:稳健的全类型音频 Deepfake 检测的基准和挑战

AT-ADD: A Benchmark and Challenge for Robust and All-Type Audio Deepfake Detection

模型评测基准与评测资源

摘要

最近的音频生成模型可以合成高保真语音、环境声音、歌声和音乐,为多媒体信任带来新的风险。现有的音频深度伪造检测 (ADD) 基准仍然主要以语音为中心,并且往往不足以代表现实的通道变化和不同的音频类型。本文介绍了 AT-ADD,这是一个大规模基准测试和挑战赛,旨在评估鲁棒的语音深度伪造检测和所有类型的音频深度伪造检测。第 1 轨评估看不见的发生器、不同的录音条件、信号扰动和重放效果下的二进制语音检测。当测试时音频类型未知时,轨道 2 评估对语音、声音、歌唱和音乐的与类型无关的真/假检测。我们详细介绍了数据集构建、评估协议和可重复基线,并分析了提交给 ACM Multimedia 2026 Grand Challenge 的最终系统。官方最强基线在 Track 1 和 Track 2 评估集上分别获得 76.73% 和 79.47% Macro-F1,而获胜挑战系统则达到 90.71% 和 96.10%。除了总体排名之外,对前五名提交的样本级别分析还检查了生成器级别和类型级别的难度、跨系统错误互补性和排名稳定性。结果表明,大规模自监督表示、条件感知增强、多作物推理和结构化融合或路由是泛化的核心,而生成器特定的鲁棒性和跨不同音频类型的一致性能仍未解决。