论文

非英语语言的推理成本:日语案例研究

Cost of Reasoning in non-English Languages: A Case Study on Japanese

模型训练强化学习

摘要

推理语言模型 (RLM) 在用英语进行推理时会达到最强的性能,而英语是面向推理的训练数据最丰富的语言。然而,推理轨迹是模型可解释性和安全性的线索,并且在实践中对于模型用户和模型开发人员都很有用。因此,希望能够开发一种以用户选择的语言进行推理的模型,同时仍然保持强大的推理性能。为此,我们研究了训练日语推理模型的可行性。我们开发了 Qwen-3-Swallow-8B 的日语推理变体,它是从 Qwen-3-8B 不断预训练的日语 LLM,使用 GRPO 并在编码、数学和科学基准方面对其进行评估。研究表明,通过使用 GRPO 训练日语持续预训练模型,推理语言控制是可行的。然而,在几个基准测试中,它的性能充其量只能与强大的英语推理基线相媲美。我们还根据日本文化基准评估了经过训练的模型,并观察到该模型的性能比基线模型更差,这表明日语推理并不能立即免费提高文化相关任务的性能。