论文

TokAN:使用自监督语音标记进行重音标准化

TokAN: Accent Normalization Using Self-Supervised Speech Tokens

应用与实践内容创作

摘要

口音标准化 (AN) 旨在将非母语 (L2) 口音语音转换为标准 (L1) 语音,同时保留说话者身份。当前的技术要么需要自然记录的并行 L1-L2 语音进行训练,要么在由合成目标监督时遭受质量下降。在本文中,我们提出了 TokAN,一种基于标记的口音归一化框架,它对从 L1-L2 联合训练的矢量量化 (VQ) 标记器中提取的自监督离散语音标记进行操作,而不需要合成监督语音。自回归编码器-解码器模型执行词元到词元的转换,将 L2 重音词元序列转换为标准语音的词元。我们还引入了基于组相对策略优化(GRPO)的强化学习(RL)后训练,使用单词错误率和口音分类器置信度作为补充奖励。非自回归流匹配合成器从转换后的词元中恢复梅尔频谱图,以源说话者嵌入为条件。我们还开发了一个流程匹配持续时间预测器,支持总持续时间感知合成,使 TokAN 适用于持续时间关键的任务,例如配音和现场直播。对七种英语口音的实验表明,TokAN 在监督 微调 后将单词错误率从 12.40% 降低到 9.89%,在 RL 后训练 后进一步降低到 9.23%,在口音减少和清晰度方面始终优于帧到帧、直接流程匹配和基于提示的标记转换基线。