论文
评估印度语言中用于自发语音检测和域外合成语音泛化的预训练语音编码器
Evaluating Pre-trained Speech Encoders for Spontaneous Speech Detection and Out of Domain Synthetic Speech Generalisation in Indic Languages
摘要
基于 Transformer 的模型在区分自发语音和脚本语音以及自然语音和合成语音方面表现出了很强的准确性,但这些结果是建立在一组资源丰富的语言基准上的,并且尚未扩展到印度语中,也没有使用嵌入几何来解释编码器行为或 Deepfake 泛化失败。我们通过评估 22 种印度语言中的 5 个冻结的 Transformer 编码器、AST、Vaani-FastConformer、Wav2vec2、Whisper 和 BEAT,并在四个 TTS 模型中进行多系统 TTS 泛化实验来解决这些差距。除了准确性之外,我们还提出了语言隔离探测和质心邻近分析。探测揭示了语言可辨别性和自发性检测之间依赖于编码器的权衡。质心分析表明,域外泛化是通过训练系统与未见过的 TTS 嵌入的接近程度来预测的,而不是通过其与自然语音的距离来预测,这一发现对现实世界中的深度伪造检测器中的训练数据选择具有直接影响。