论文

PAMT:多领域机器翻译的流程对齐强化学习

PAMT: Process-Aligned Reinforcement Learning for Multi-Domain Machine Translation

模型训练强化学习

摘要

多领域机器翻译 (MDMT) 需要的不仅仅是流畅的生成:它需要领域敏感的翻译决策,例如领域消歧、术语控制和文体适应。大型推理模型 (LRM) 通过中间翻译步骤使此类决策变得明确,但我们对 15 个领域和四个翻译方向的分析表明,这种显式推理是一把双刃剑:它改进了长格式和高难度的翻译,但在术语密集和文体受限的环境中经常出现偏差。我们将这种失败追溯到信用分配瓶颈:现有方法优化了最终输出或粗略轨迹,但无法识别哪些翻译步骤实际上有助于最终翻译。为了解决这个问题,我们提出了 PAMT,这是一种流程一致的训练框架,它将冷启动领域感知 Long-CoT 监督与强化学习相结合。 PAMT 使用序列级格式和最终翻译的结果奖励,以及步骤级过程奖励来衡量每个显式翻译步骤增加参考翻译的可能性的程度。在两个骨干网中,PAMT 改进了基本模型,平均优于 MT 专用基线,并且在域内、OOD 和多语言设置中与强大的 LLM/LRM 保持竞争力。