论文

强化学习引发未见语言翻译的语境学习

Reinforcement Learning Elicits Contextual Learning of Unseen Language Translation

模型训练强化学习

摘要

之前的工作表明,大语言模型 (LLM) 可以通过持续训练甚至在上下文中对语法书进行编码来翻译看不见的或资源匮乏的语言。然而,这两种方法通常都会过度拟合特定语言,在测试时零样本传输有限。为了大规模翻译资源极少的语言,我们认为 LLM 必须获得利用上下文语言知识而不是记住特定语言的元技能。在本文中,我们提出了一种强化学习(RL)方法,使用表面级翻译度量(chrF)作为奖励,在丰富的语言背景下进行未见过的语言翻译。根据经验,尽管奖励很轻,但我们的 RL 训练模型可以有效地从提供的上下文中提取和应用相关语言信息,从而在完全未见过的语言上获得比上下文学习或监督 微调 更好的翻译。我们的分析表明,基于结果的强化学习可以超越数学和编码等传统推理任务,成为从上下文中学习语言的方法。