论文
GROW:自回归扩散语音合成的组相对优势加权同策略强化学习
GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model
摘要
确定性 ODE 采样使得流匹配文本到语音的强化学习变得复杂:轨迹级策略梯度方法通常将 ODE 转换为 SDE 并跟踪每步似然比,从而引入随机扰动和大量开销。我们提出了 GROW,一种群体相对优势加权 同策略 RL 方法,直接作用于标准流匹配目标。对于每个提示,GROW 对一组 同策略 话语进行采样,分别标准化该组内的可懂度和说话者相似度奖励,并将它们组合起来重新加权流匹配回归。 Wasserstein-2 速度惩罚将更新的模型锚定到冻结的预训练参考。引入群体平均奖励基线将奖励权重转换为优势权重。对于具有集中奖励的强预训练 TTS 模型,正指数权重主要是与奖励无关的自我模仿,而零均值符号优势则保留了有效的组内信用分配。 GROW 在 DiTAR 上实例化并在 LibriSpeech 和 Seed-TTS EN/ZH 上进行评估,将平均 WER 从 2.016 降低到 1.558,并将说话者相似度从 0.676 提高到 0.715,同时保持 UTMOS。通过 10-NFE 训练采样轨迹和 32-NFE 评估,GROW 保持了相当的性能,同时训练速度比 32-NFE DiTAR-GRPO 快 2.9 倍。我们将开源完整的 GROW 代码、忠实的 DiTAR 复制品以及所有模型检查点。