论文

用于口音转换的冻结语音表示中的部分口音控制编辑

Partial Accent-Control Editing in Frozen Speech Representations for Accent Conversion

应用与实践内容创作

摘要

口音转换是修改语音录音的任务,使其听起来更接近目标口音,同时保留语言内容和其他与说话者相关的特征。大多数口音转换系统都使用经过训练的生成模型。虽然它们可以诱导目标口音的语音,但口音修改的强度在推理时不可控,因此很难分析口音转换的强度如何影响源保留。我们提出了部分重音控制编辑(PACE),这是一种重音转换框架,基于对冻结 WavLM 表示的编辑,无需训练重音条件生成器。首先将约束编辑应用于源 WavLM 特征,然后将其与从非平行口音示例检索的目标口音参考特征融合。融合权重用于控制重音转换强度和其他源属性的退化之间的权衡。使用一套五个指标,并考虑到口音纠缠的说话者相似性的成本,我们表明 PACE 在口音转换和源保留方面远远优于一对竞争基线。