论文

您的语音克隆系统实际上是一个语音匿名器

Your Voice Cloning System is Secretly a Voice Anonymizer

模型推理推理验证与自校正

摘要

说话人匿名化抑制了语音中的说话人识别属性,同时保留了语言内容和质量。我们建议重新利用 XTTSv2(一种经过 27000 小时语音训练的多语言语音克隆模型),无需重新训练即可实现说话者匿名化。我们的主要见解是,XTTSv2 的语音克隆功能可以独立于说话者身份保留韵律结构,从而通过调节伪说话者来实现语音转换。我们引入了一种迭代细化策略,通过最大化说话者差异性和清晰度的调和平均值来平衡隐私和实用性。通过对 CommonVoice 和多语言 LibriSpeech 的七种欧洲语言进行评估,我们的系统实现了近乎最佳的隐私性(EER $\approx$ 0.49)、有竞争力的清晰度以及比专用匿名化基线更好的语音质量,同时不需要特定于语言的训练。我们在这里发布代码:https://github.com/rm00cr/coqui-tts。