论文

学习何时进行多语言推理翻译

Learning When to Translate for Multilingual Reasoning

模型训练强化学习

摘要

推理语言模型 (RLM) 在复杂的推理任务上取得了出色的性能,但仍然表现出巨大的多语言推理差距,这主要是由于非英语输入中的语言理解失败。英语翻译可以通过以 RLM 可以更可靠地解释的形式表达非英语输入来减轻这些失败,但当模型可以根据原始查询进行可靠推理时,就不需要翻译每个输入。为了应对这一挑战,我们提出了 Luar,一种语言理解边界感知强化学习框架,可训练 RLM 在直接理解不可靠时有选择地调用翻译。 Luar 训练模型在直接解决原始输入和对其英文翻译进行推理之间进行选择,仅当翻译器增强推理预计将大大优于直接推理时才鼓励翻译。在多语言推理基准测试中,Luar 的性能优于标准 GRPO 和其他基于训练的基准,尤其是在低资源语言上取得了很大的进步。进一步的分析表明,Luar 在直接推理就足够的情况下避免了不必要的翻译,同时将其翻译器调用行为扩展到看不见的低资源语言。总之,我们的工作提出了一种选择性的多语言推理方法:只有当 RLM 的直接理解不可靠时,它们才能学会调用翻译。该项目将在 https://github.com/deokhk/LUAR 上公开