论文
忘记你忘记的人:说话者忘记学习以防止零样本文本转语音中的重新识别
Forget who you Forgot: Speaker Unlearning to Prevent Re-Identification in Zero-Shot Text-to-Speech
摘要
最近的零样本文本转语音 (ZS-TTS) 系统可以仅从几秒钟的参考语音中高保真地再现说话者的声音,这引发了对未经授权的语音克隆和模仿的担忧。最近出现了一种方法,可以选择性地抑制选择退出的说话者的这种能力,同时保留其他说话者的合成能力。尽管现有方法降低了说话者的相似度,但防止重新识别通常会面临语音质量的严重下降。受这一观察的启发,我们提出了 GUARD,这是一种轻量级的说话人身份学习框架,它将学习的说话人门与冻结 TTS 主干上的说话人无关激活控制相结合。使用群体相关奖励优化来优化引导向量,以将输出从遗忘说话者转移到群体水平的冒名顶替者相似度,同时保持可懂度和语音自然度。在 CosyVoice2 上,GUARD 将遗忘说话人的相似度从 0.541 降低到 0.103,并将 150 名说话人图库中的重新识别准确率从 73.5% 降低到 0.5%,同时保留保留说话人的再现。结果表明,仅相似性减少可能无法完全表征成功的说话人身份遗忘,并强调重新识别作为其评估的补充标准。