论文

AT-ADD:全类型音频Deepfake检测挑战评估计划

AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan

模型评测基准与评测资源

摘要

音频 大语言模型 (ALLM) 的快速发展实现了语音和非语音音频(包括音效、歌声和音乐)的经济高效、高保真生成和操作。虽然这些功能促进了创造力和内容制作,但它们也带来了重大的安全和信任挑战,因为现在可以大规模生成和传播逼真的音频深度伪造品。然而,现有的音频深度伪造检测 (ADD) 对策 (CM) 和基准仍然主要以语音为中心,通常依赖于特定于语音的伪影,对现实世界的失真表现出有限的鲁棒性,并且对异构音频类型和新兴欺骗技术的泛化也受到限制。为了弥补这些差距,我们提出了 ACM Multimedia 2026 的全类型音频 Deepfake 检测 (AT-ADD) 大挑战,旨在将受控学术评估与实用多媒体取证联系起来。 AT-ADD 包括两个方向:(1) 鲁棒语音 Deepfake 检测,它在现实场景下并针对看不见的最先进的语音生成方法来评估检测器; (2) 全类型音频 Deepfake 检测,将检测范围从语音扩展到各种未知的音频类型,并促进跨语音、声音、歌唱和音乐的类型无关泛化。通过提供标准化数据集、严格的评估协议和可重复的基线,AT-ADD 旨在加速强大且通用的音频取证技术的开发,在合成音频普遍存在的时代支持安全通信、可靠的媒体验证和负责任的治理。