论文
用于多语言机器翻译的 Open 大语言模型 的无参考 后训练
Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation
摘要
我们通过开放的 大语言模型 研究用于多语言机器翻译的无参考 后训练。从监督微调的 MiLMMT-46-v0.1 模型开始,我们应用组相对策略优化(GRPO),其奖励对两个无参考质量估计模型进行平均,并通过语言识别进行门控。然后,我们对监督 微调 (SFT) 和强化学习 (RL) 模型检查点进行线性插值以获得 MiLMMT-46-v1.0。在 46 种语言中,所得到的模型持续提高了 SFT 模型的翻译质量,超越了最近强大的开放基线,包括 Seed-X、HY-MT2 和 TranslateGemma,并在 Google Translate、Gemini 3 Pro 和 GPT-5 等评估的专有系统上取得了领先的无参考分数。我们进一步研究了 同策略 蒸馏 (OPD),发现它达到但没有超过通过检查点插值的 RL 实现的质量边界。我们发布模型和代码以促进未来的研究。