论文

重写到翻译,翻译到奖励:机器翻译中源重写的强化学习

Rewrite to Translate, Translate to Reward: Reinforcement Learning for Source Rewriting in Machine Translation

模型训练强化学习

摘要

之前的工作探索了提示 大语言模型 (LLM) 在翻译前重写源文本,目的是提高机器翻译 (MT) 质量。然而,我们发现这种基于提示的重写会降低而不是提高翻译质量,特别是在使用较小的 LLM(例如 4B 参数模型)时。我们认为,这种限制源于仅通过自然语言提示控制重写行为的困难:重写只有在导致更好的下游翻译时才有用,但现有的基于提示的方法并未明确针对该信号进行优化。为了解决这个问题,我们提出了 \textbf{RLSR} (\textbf{R}einforcement \textbf{L}earning for \textbf{S}ource \textbf{R}ewriting),这是一个强化学习框架,它通过每次重写产生的下游翻译质量改进获得奖励来训练重写模型。跨 6 个 MT 模型和 16 个语言对的实验表明,我们的 4B RLSR 训练重写模型显着优于无重写基线和相同规模的基于提示的重写基线,同时与使用 235B LLM 的基线保持竞争力。我们的模型和代码位于:https://github.com/vlaks425/MT-RLSR