论文

用于 MT 的无参考强化学习 微调:Seq2Seq 视角

Reference-Free Reinforcement Learning Fine-Tuning for MT: A Seq2Seq Perspective

模型训练强化学习

摘要

生产机器翻译绝大多数依赖于编码器-解码器 Seq2Seq 模型,但 MT 微调 的强化学习方法主要针对 $\geq$7B 参数的仅解码器 LLM,对编码器-解码器架构的系统研究有限。我们使用混合无参考奖励(LaBSE 和 COMET-Kiwi)将组相对策略优化应用于 NLLB-200(600M 和 1.3B),该奖励在 微调 时间不需要并行数据,对 13 种类型不同的语言进行评估。 GRPO 在所有 13 种语言上都取得了一致的改进,繁体中文高达 $+$5.03 chrF++,并且在没有任何目标语言数据的情况下,在形态复杂的语言上与 3 epoch 监督的 微调 竞争。我们确定了一种一致的经验模式,其中基线性能最弱且奖励可辨别性最高的地方收益最大,使得这种方法在并行数据最稀缺的地方最有效,并在英语和西班牙语源语言中复制这种模式。