论文

缩小年龄差距:检测神经音频编解码器合成的老年人语音 Deepfake

Bridging the Age Gap: Towards Detecting Neural Audio Codec Synthesized Elderly Speech Deepfake

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

在本研究中,我们引入了老年人编解码器伪造检测(ECFD)任务,并发布了英文和中文的老年人编解码器伪造(ECF)数据集。我们表明,在之前的基准 CF 数据集上训练的最先进的 CF 检测器对老年人语音的泛化能力很差,揭示了一个严重的漏洞。我们进一步假设并证明,LanguageBind (LB) 和 ImageBind (IB) 等多模态基础模型 (FM) 对于 ECFD 更有效,因为它们在跨模态预训练期间接触了老年人内容。先前证据表明 FM 融合可以增强下游性能,因此我们探索了 ECFD 的 FM 融合。为此,我们提出了 BONSAI,一种采用 Jensen-Shannon Divergence 作为融合机制的新颖框架。融合 LB 和 IB 的 BONSAI 平均 EER (%) 为 1.66,优于单个 FM 以及具有竞争力的 SOTA 基线,为 ECFD 任务建立了新基准。