论文

转录、翻译和优化:语音翻译的联合奖励学习

Transcribe, Translate, and Optimize: Joint Reward Learning for Speech Translation

模型训练强化学习

摘要

在基于 LLM 的语音翻译中,基于转录的思想链 (CoT) 存在监督微调 (SFT) 中使用的参考转录本与推理时模型生成的转录本之间不匹配的问题。为了解决这个问题,我们提出通过组相对策略优化(GRPO)进行联合识别和翻译微调。我们对转录本和翻译进行评分,翻译以模型生成的转录本为条件,并比较三种词元优势策略。我们使用跨四种语言的 Qwen2.5-Omni-3B,在 SFT 和 GRPO 下针对直接语音翻译 (Direct ST) 评估 CoT,在 CoVoST 2 上进行训练并在 CoVoST 2 和 FLEURS 上进行测试。 CoT GRPO 在 CoVoST 2 和 FLEURS 上的平均 BLEU 点比 Direct ST GRPO 高出 1.77 和 0.83。与 CoT SFT 相比,GRPO 使 BLEU 提高了 0.82 和 0.67 个点,字错误率(WER)相对降低了 8.8% 和 7.2%。这些结果凸显了强化微调是减轻训练-推理不匹配、共同改善识别和翻译的有效方法。