论文
MADBench:模态感知音频 Deepfake 检测的基准
MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection
摘要
语音合成和音频生成方面的最新进展使得高保真声学伪造成本低廉且难以归因,从而实现了真实的攻击场景,其中语音和背景音频在真实视频上独立操纵。然而,现有的研究要么侧重于视觉操纵,孤立地解决语音检测,要么将语音和非语音音频合并为单个无差别的音频流,忽视了背景音频带来的独特的取证挑战。这种合并是必然的:这两个声学成分源于根本不同的生成机制,表现出不同的伪影轮廓,并对检测系统提出了不同的挑战。我们推出了 MADBench,这是第一个将语音和环境音频视为不同声学组件的基准测试,从而能够对独立操纵的伪造源中的音频深度伪造检测进行组件感知评估。我们在统一协议下对代表性的最先进探测器和多模态 大语言模型 进行基准测试。我们的实验表明,环境音频操纵比通用编码器上的合成语音更容易被检测到,而现有的预训练检测器在两个声学组件上都失败了,并且操纵的环境音频不对称地降低了语音深度伪造检测,这些结果在先前基准的单标签范例下完全不可见。 MADBench 为未来稳健、组件感知的音频深度伪造检测的研究奠定了严格的基础。