论文
超越英语的 GRPO:非英语和多语言环境中 GRPO 的大规模研究
GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings
摘要
具有可验证奖励的强化学习(RLVR)通常通过组相对策略优化(GRPO)进行优化,已成为提高预训练语言模型推理能力的核心方法,但目前的研究仍然主要以英语为中心。我们对多语言和非英语 GRPO 进行了大规模的实证研究,涉及广泛的基础模型、训练语言和不同的推理语言奖励。我们发现,母语推理训练通常与英语推理训练差距很小。我们进一步观察到强大的跨语言迁移:一种语言的训练通常可以提高许多其他语言的表现。然而,具体趋势高度依赖于模型和语言。在某些情况下,使用特定语言进行训练会导致其他语言的域外能力严重退化。我们的分析表明,英语以外的 RLVR 可以提供广泛的跨语言收益,但也需要广泛的评估来检测特定于语言的回归。