论文
VietPrism:具有多种方言和语码转换的大规模越南语语音和深度伪造语料库
VietPrism: A large-scale Vietnamese speech and deepfake corpus with diverse dialects and code-switching
摘要
越南语音研究受到资源的限制,这些资源将自动语音识别与说话人、方言、代码转换和深度伪造分析隔离开来。我们推出了 VietPrism,这是一个开放的多领域语料库,它将这些维度大规模地整合在一起:来自 1,262 位经过验证的发言者在 8,388 个真实世界视频中的 993.4 小时和 403,941 条真实话语。据我们所知,它是第一个联合提供文字记录、一致的说话者身份、五种方言组以及自然发生的越南语-英语语码转换的大型越南语语料库,按持续时间计算,该语料库占语料库的近一半。我们还使用四个开源和商业合成系统创建了超过 3100 小时的恶搞语音。每一次恶搞都以经过验证的说话者参考为条件,并与转录本和说话者匹配的真实话语配对,从而实现独特的受控评估,减少词汇和身份混淆。对五个预训练多语言检测器的零样本评估揭示了惊人的脆弱性:检测器-生成器配对之间的 EER 差异很大,而随着说话者相似度的增加,最近的多语言检测器 DFA-1B 从 16.3% 降级到 33.6%。方言分层结果进一步暴露了与模型相关的差异。通过将自然语言多样性与受控欺骗生成相结合,VietPrism 为越南语语音建模和值得信赖的音频深度伪造检测提供了具有挑战性的基础。