Indic-CodecFake 与 SATYAM 的结合:检测印度语言中的神经音频编解码器合成语音 Deepfakes
Indic-CodecFake meets SATYAM: Towards Detecting Neural Audio Codec Synthesized Speech Deepfakes in Indic Languages
摘要
在神经音频编解码器 (NAC) 的推动下,音频 大语言模型 (ALM) 的快速发展导致了高度逼真的语音深度伪造的出现,通常称为 CodecFakes (CF)。因此,CF检测越来越受到研究界的关注。然而,现有的研究主要集中在英语或汉语上,而印度语言的脆弱性基本上未被探索。为了弥补这一差距,我们引入了 Indic-CodecFake (ICF) 数据集,这是第一个大规模基准,包含跨多种印度语言、不同说话者配置文件和多种 NAC 类型的真实语音和 NAC 合成语音。我们使用 IndicSUPERB 作为生成 ICF 数据集的真实语音语料库。我们的实验表明,在以英语为中心的数据集上训练的最先进 (SOTA) CF 检测器无法推广到 ICF,这凸显了印度语语音中语音多样性和韵律变异性带来的挑战。此外,我们在 ICF 数据集上的零样本设置中对 SOTA ALM 进行了系统评估。我们评估这些 ALM,因为它们显示了对不同语音任务的有效性。然而,我们的研究结果表明,当前的 ALM 表现始终较差。为了解决这个问题,我们提出了 SATYAM,一种专为印度语言的 CF 检测而定制的新型双曲 ALM。 SATYAM 使用双曲空间中的 Bhattacharya 距离集成了 Whisper 的语义表示和 TRILLsson 的韵律表示,随后在融合的语音表示和输入条件提示之间执行相同的对齐过程。这种双阶段融合框架使 SATYAM 能够有效地对语音(语义-韵律)内和跨模态(语音-文本)之间的层次关系进行建模。广泛的评估表明,SATYAM 在 ICF 基准上始终优于竞争性端到端和基于 ALM 的基线。