论文

神经机器翻译的回译增强直接偏好优化

Backtranslation Augmented Direct Preference Optimization for Neural Machine Translation

模型训练偏好优化

摘要

当代神经机器翻译(NMT)系统几乎完全是通过监督并行数据训练构建的。尽管取得了巨大进步,这些系统仍然存在持续的翻译错误。本文提出基于强化学习(RL)的后训练范式可以有效纠正此类错误。我们引入了一种新颖的框架,仅需要通用文本语料库和专家翻译器(可以是人类或人工智能系统)来提供迭代反馈。在我们的实验中,我们特别关注英语到德语的翻译作为代表性的高资源语言对。至关重要的是,我们使用直接偏好优化(DPO)来实现这个基于强化学习的 后训练。将我们的 DPO 驱动框架应用于 gemma3-1b 模型可以显着提高翻译质量,将英语到德语任务的 COMET 分数从 0.703 提高到 0.747。结果表明,DPO 通过基于偏好的 后训练 为增强预训练 NMT 模型提供了一种高效且稳定的途径。