论文

免专项训练的引导式语音匿名化

Voice Anonymization Made Simple: Training-Free Anonymization with Projected Classifier-Free Guidance

模型推理解码与生成控制

摘要

语音匿名化旨在隐藏说话者身份,同时保留语言和副语言信息,但许多现有方法需要专用的训练。我们提出了一种 无需训练,用于预训练流匹配语音转换系统的两阶段匿名化方法。在条件构建阶段,在随机选择的说话者上下文下重新生成源内容表示,以减少残留的源-说话者信息,同时保留语言内容。在语音生成阶段,源语音用于识别与原始说话者相关的生成方向,并且源对齐分量被抑制,同时保留有用的内容引导。所提出的方法仅修改 推理时的 条件和指导,而不更新任何预训练的参数。 VoicePrivacy 2026 Track 1 的实验表明,两阶段方法提高了说话人隐私,同时保持有竞争力的词错误率和情绪识别性能。

免专项训练的引导式语音匿名化:论文原图
图 1:标准语音转换、内置匿名化以及共享 Seed-VC v2 骨干模型 中提出的 无需训练方法的概述。所提出的方法修改条件构造以减少源-说话者依赖性,并修改生成指导以抑制源对齐信息。第二节和第三节介绍了详细的条件和指导定义。