论文

推理的代价:神经机器翻译强化学习的成本与质量权衡

The Price of Reasoning: Cost-Quality Tradeoffs in Reinforcement Learning for Neural Machine Translation

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)已被确立为 大语言模型(LLM)的 后训练 的可行范例,包括下游任务,例如神经机器翻译(NMT)。最新研究表明,由于 RLVR 具有诱导推理能力,RLVR 可能成为翻译法律文档的首选训练方法,但这提出了一个问题:它是否真的归因于推理,或更普遍地归因于训练范式。我们研究了在训练和推理过程中将模型的推理轨迹包含在生成的响应中的重要性,方法是系统地将模型的推理轨迹从其中一个阶段中省略。我们的实验表明,包括推理,特别是在推理过程中,对整体翻译质量具有积极影响。此外,我们认识到推理会导致输出标记的增加,因此我们研究增加的计算需求和提高的翻译质量之间的成本质量权衡。