论文

弥合东南亚差距:东南亚语言神经音频编解码器合成语音 Deepfakes 的初始基准

Bridging the SEA Gap: An Initial Benchmark for Neural Audio Codec-Synthesized Speech Deepfakes in South-East Asian Languages

模型评测基准与评测资源

摘要

Codecfakes (CF) 是一种通过音频语言模型 (ALM) 生成的语音深度伪造,神经音频编解码器 (NAC) 构成了语音编码和生成的核心机制。 CF 表现出与基于声码器的深度伪造不同的分布特征,导致在声码器数据上训练的检测器对 CF 检测的泛化能力很差。尽管这导致了 CF 检测基准的开发,但现有资源主要局限于英语(也有一定程度的中文),而东南亚 (SEA) 语言尚未得到探索。为了弥补这一差距,我们推出了 SEA-CF,这是第一个用于 CF 检测的大规模基准,涵盖多种 SEA 语言、不同的说话者配置文件和广泛的 NAC 架构。 SEA-CF 是通过综合公开可用的真实语音语料库构建的。我们的实验表明,由于语言特定的语音结构、音调变化和丰富的韵律多样性,在以英语为中心的数据集上训练的最先进 (SOTA) CF 检测器无法推广到 SEA 语音。我们进一步对 SEA-CF 上最近的 SOTA ALM 进行了全面的零样本和微调评估。 微调 ALM 提高了性能,但是,由于其规模,这些 ALM 非常大,对于实际应用程序来说是不切实际的,特别是在资源匮乏和延迟受限的设置中。为了解决这一限制,我们提出了一种专为 CF 检测量身定制的新型小型 ALM GARUDA,它在保持轻量级的同时提供强大的性能。广泛的评估表明,所提出的 Small-ALM 优于强大的端到端和基于 ALM 的基线,为 SEA 语言及其他语言中的稳健 CF 检测建立了新的实用方向。