论文

当您只有合成语音时:最好致电 GRPO

When Synthetic Speech Is All You Have: Better Call GRPO

模型训练强化学习

摘要

基于 LLM 的 ASR 适用于银行业等受监管领域,但存在隐私瓶颈:真实语音的收集成本高昂且受到法律限制,这使得合成文本转语音 (TTS) 成为有吸引力的替代品。然而,合成语音在声学上与真实录音仍然不匹配,而解决这一差距的工作一直在受监督的 微调 (SFT) 范围内进行。相反,我们转向强化学习,并表明组相对策略优化 (GRPO) 从相同的合成语音中提取的内容远多于 SFT。 GRPO 模型的综合适应是一种奖励低 WER 假设的无批评方法,相对于 SFT,WER 降低了 40%(36.71\%$\to$22.09\%),而 SFT-then-GRPO 组合将其进一步推至 45\%。我们将增益追踪到行为而不是表示:GRPO 通过更好地锚定对音频的注意力来改进停止校准和语音到文本对齐,从而减少插入错误,从而保持早期层表示完好无损。当合成语音是主要资源时,强化学习应优先于监督 微调。