论文

优点:针对以中文为中心的低资源机器翻译的多语言专家奖励知情调整

MERIT: Multilingual Expert-Reward Informed Tuning for Chinese-Centric Low-Resource Machine Translation

应用与实践机器翻译

摘要

从中文到资源匮乏的东南亚语言的神经机器翻译(NMT)仍然受到干净平行语料库极度稀缺和现有挖掘数据中普遍存在的噪音的严重限制。这种长期短缺不仅阻碍了有效的 模型训练,而且与高资源方向保持了巨大的性能差距,尽管大型多语言模型最近取得了进展,但老挝语、缅甸语和他加禄语等数百万语言使用者的翻译系统质量却持续低下。我们引入了 \textbf{M}ultilingual \textbf{E}xpert-\textbf{R}eward \textbf{I}nformed \textbf{T}uning (\textbf{MERIT}),这是一个统一的翻译框架,它将传统以英语为中心的 ALT 基准转换为以中文为中心的五种东南亚低资源语言 (LRL) 评估套件。我们的框架将特定于语言的标记前缀(LTP)与受监督的 微调(SFT)以及由语义对齐奖励(SAR)引导的新颖的组相对策略优化(GRPO)结合起来。这些结果证实,在 LRL{\textrightarrow} 中文翻译中,有针对性的数据管理和奖励引导优化显着优于单纯的模型缩放。