论文

冻结声学评判器辅助强化学习,减少语音识别插入幻觉

Grounded in Sound: Reinforcement Learning with a Frozen Acoustic Judge to Curb ASR Insertion Hallucinations

模型训练强化学习

摘要

当强化学习(RL)用于训练后自动语音识别(ASR)时,奖励几乎总是存在于文本空间中:它将假设与参考进行比较,并且从不检查假设是否得到音频的支持。在高度常规的演讲中,这提供了一条捷径——先从强语言中猜测而不是倾听。一旦声学效果下降,快捷方式就会不受控制地运行并发出流畅但不受音频支持的词语,即插入错误。我们提出了一种声学保真度奖励:GRPO 奖励增强了单独预训练的、永久冻结的、非自回归字符级 wav2vec2-CTC 声学判断,严格在训练中使用,在推理中不使用,其中单个模型贪婪地进行解码。在 LibriSpeech 上进行训练,并在包括真实 AMI 会议语音(33,282 个话语条件实例)在内的六层难度梯度上进行评估,该方法将近距离谈话 AMI-IHM 上的插入错误减少了 28.3%,在远场 AMI-SDM 上减少了 22.3%,同时将 AMI-SDM 上的 WER 从 35.89% 降低到 34.71%,并且在其他五个上没有显示出可检测到的 WER 差异层,对照时间表匹配的 WER-GRPO 基线。插入减少在会议级集群引导下保持不变。四种预先指定的分析支持内容条件插入校准:在难以理解的音频上输出崩溃 85-90%,但保留了能量和语音活动;评估的 32 最佳 CTC 重新评分配置无法恢复增益,但 RL 将其内部化为单个贪婪解码运行;在所有四种评估环境中,仅政策信心产生较低的插入-AURC。我们将其框架为一篇机制论文,在一个实例中进行了演示:一个 7B 演讲大语言模型和一个 0.3B CTC 法官。