论文

后训练 具有感知奖励的语音增强语言模型

Post-Training Speech Enhancement Language Models with Perceptual Rewards

模型训练强化学习

摘要

语音增强语言模型在离散音频标记上进行训练时取得了很好的结果,但它们的优化依赖于 词元级 交叉熵,而不是用于评估的感知指标。我们引入了 后训练 阶段,用于使用具有多度量感知奖励的组序列策略优化 (GSPO) 的自回归语音增强语言模型。我们的方法直接优化不可微分的质量指标(DNSMOS、WER 和 UTMOS)作为奖励信号,无需学习代理或离线偏好对。我们的方法应用于两种自回归基本模型 UniSE 和 GenSE,在 DNS2020 基准测试中取得了最先进的结果。人类评估消融进一步表明,复合多指标奖励优于任何单指标变体,证实多奖励优化避免了单指标训练中观察到的 奖励作弊。