论文
匿名化,而不是消除:保留实用性的语音匿名化
Anonymization, Not Elimination: Utility-Preserved Speech Anonymization
摘要
对大规模语音数据的日益依赖使隐私保护成为一个关键问题。然而,现有的匿名方法通常会降低数据效用,例如破坏声学连续性或减少声音多样性,从而损害语音数据对于自动语音识别 (ASR)、文本转语音 (TTS) 和语音情感识别 (SER) 等下游任务的价值。目前的评估实践也很有限,因为它们主要依赖于使用预训练模型对匿名语音进行直接测试,仅提供部分实用性视图。为了解决这些问题,我们提出了一种新颖的两阶段框架,可以保护语言内容和声学特性,同时保持可用性。对于内容隐私,我们采用生成语音编辑模型来无缝替换个人身份信息(PII);对于语音隐私,我们引入了 F3-VA,这是一种基于流程匹配的匿名化框架,采用三阶段设计,可产生多样化且独特的匿名说话者。为了实现更全面的评估,我们使用基于声学和内容的说话者验证指标来评估隐私,并通过从头开始训练 ASR、TTS 和 SER 模型来评估实用性。实验结果表明,与 VoicePrivacy Challenge 的基线相比,我们的框架以最小的效用降低实现了更强的隐私保护,而所提出的评估协议更真实地反映了隐私保护下匿名语音的效用。