论文
NouveauVoice:为语音匿名化生成新颖的伪说话者
NouveauVoice: Generating Novel Pseudo Speakers for Voice Anonymization
摘要
语音合成和语音转换 (VC) 领域的先进神经技术给个人隐私带来了严重风险,因此需要强大的说话者匿名系统 (SAS)。现有的 SAS 方法修改手工制作的特征空间或说话人嵌入空间中的语音特征,通常难以在生成的语音中提供足够的身份差异。在本文中,我们提出了 NouveauVoice,一种基于分层深度变分自动编码器(NVAE)的新型伪说话人生成框架。我们的方法作为独立插件模块集成在最先进的架构(FACodec 和 CosyVoice2)之上,利用易于处理的采样和证据下界 (ELBO) 目标来合成高度表现力的伪说话人嵌入,并显着增强说话人的多样性。根据类似于 VoicePrivacy Challenge 的协议以及最大平均差异 (MMD) 分析来评估我们的框架,我们证明 NouveauVoice 实现了强大的身份隐藏,相对于自动说话人验证攻击者模型,产生了超过 38% 的等错误率 (EER)。我们的系统在严格的匿名性、丰富的伪说话者多样性和下游语音效用(例如清晰度和情感表达力)之间显示出合理的权衡。