论文
用假名域 ASR 奖励优化日语 TTS 发音
Pronunciation-Oriented Reinforcement Learning for Japanese Text-to-Speech with Kana-Domain ASR Rewards
摘要
自动语音识别 (ASR) 计算的字符错误率 (CER) 被广泛用作文本转语音 (TTS) 系统的强化学习 (RL) 后训练的清晰度奖励。然而,对于日语,拼写 CER 引入了面向发音优化的表示不匹配:不同的汉字阅读可能会折叠为相同的拼写表示,而等效发音可能会接受不同的拼写形式。相反,我们使用假名转录 ASR 模型和参考读数 (Kana-CER) 来计算假名域中的 CER。在匹配组相对策略优化 (GRPO) 条件下,Kana-CER 相对于拼写 CER 奖励,将目标汉字阅读错误减少约 26%,同时保持可比较的拼写 CER 和相似的说话人相似性以及客观语音质量。它还以更少的优化步骤(4k 与 18k)达到最佳验证性能。我们进一步观察到在非正则 Kana-CER 优化下严重的输出伸长,这被 KL 正则化大大抑制。