论文
ReflectMT:内部化反射以实现高效、高质量的机器翻译
ReflectMT: Internalizing Reflection for Efficient and High-Quality Machine Translation
摘要
近年来,人们对将大型推理模型 (LRM) 应用于机器翻译 (MT) 的兴趣日益浓厚。现有方法主要采用“先思考然后翻译”的范式。尽管显式推理轨迹可以显着提高翻译质量,但它们会带来高昂的推理成本和延迟。为了解决这些限制,我们提出了 ReflectMT,这是一种用于机器翻译的两阶段反射内化算法,采用“先翻译后思考”范例。我们的方法通过强化学习开发模型的“翻译-反映-细化”能力。在第一阶段,我们培养模型的高质量反思和细化能力,从而增强其语义理解和特定任务知识。在第二阶段,我们训练模型以内化反思过程中获得的知识。因此,在推理过程中,ReflectMT 以直接翻译模式运行,无需任何明确的推理步骤,就能在第一次尝试时生成高质量的翻译。在 WMT24 等数据集上的实验结果表明,我们的模型在推理过程中的首轮翻译在自动指标和基于 GPT 的评估方面均优于 DeepSeek-R1 等多步推理 LRM,在基于 GPT 的翻译质量评估中实现了 2.16 点的改进,同时减少了 94.33% 的词元消耗。