论文

少看多听:流媒体 ASR 联合奖励 GRPO

Look Less, Hear Better: Jointly Rewarded GRPO for Streaming ASR

模型训练强化学习

摘要

流式自动语音识别 (ASR) 必须根据其转录内容以及提交每个单词的速度进行综合判断。延迟流建模 (DSM) 已成为流式传输大型音频语言模型的主导范例,暴露了限制解码器前瞻的结构延迟 $τ$。我们表明,$τ$ 不能很好地代表用户感知的延迟,并且 DSM 基于对齐的监督将延迟留在桌面上:每个 $τ$ 使用相同的强制对齐转录本,迫使模型保留它可能已经提交的单词。我们引入了 AWED,这是一种相对于每个单词的声学末端定义的单词级发射延迟度量,并在奖励下使用 GRPO 对 DSM 识别器进行后训练,该奖励联合对转录准确性和测量延迟进行评分。在单个操作点($τ=6$ 帧)上进行训练,我们的模型在所有评估的前瞻预算中主导其监督微调初始化和 Voxtral Realtime 主干网络:它在 80ms 结构延迟时相对将 WER 降低了 30.8%,在 480ms 时相对降低了 5.7%,同时将中值 AWED 从 1.17s 降低到 1.04s。因此,延迟奖励的后训练提高了准确性——流式 ASR 的延迟帕累托前沿,无需更改架构。