论文
语言增强音频语音数据 (LinguAS)
Linguistically Augmented Audio Speech Data (LinguAS)
摘要
恶意创建的虚假语音,包括深度伪造和欺骗的音频,正在以惊人的速度激增,检测模型正在竞相保持领先地位。然而,大多数检测模型都经过训练,仅对帧级音频特征进行推理,而没有在更大的时间尺度上利用有价值的语言线索。为了解决这一差距,我们提出了语言增强音频语音数据(LinguAS),这是一个真实和深度伪造的音频样本的数据集,用五个战略选择的专家定义的语言特征(EDLF)进行注释,这些特征在英语口语中经常出现,是自然人类语音的特征。 LinguAS 包含 800 多个音频样本,每个样本都用 EDLF 进行注释。该数据集具有均衡数量的四种欺骗音频攻击类型和成比例数量的真实语音样本。我们还包含有关说话者性别的元数据以及每个欺骗音频样本的生成器/源,为 模型训练 提供更多粒度。我们发现,使用 EDLF 增强的数据训练的模型显着提高了模型性能,超出了 ASVspoof 2021 深度学习基线以及 HuBert 和 XLSR 等 SSL 模型。 LinguAS 的增强语言、性别和生成器元数据为音频深度伪造研究人员提供了一个强调真实人类语言特征的数据集,以改进伪造语音的模型推理。数据和代码是公开的。