论文
ReasonXL:在不牺牲性能的情况下改变 LLM 推理语言
ReasonXL: Shifting LLM Reasoning Language Without Sacrificing Performance
摘要
尽管多语言能力取得了进步,但大多数 大语言模型 (LLM) 在训练中以及最重要的是在推理轨迹的生成中仍然以英语为中心。即使在处理非英语问题时,这些模型也主要用英语进行推理,从而与非英语使用场景产生根本性的不匹配。我们通过三项贡献直接解决了这种差异。 (i) 我们推出了 ReasonXL,这是第一个跨越五种欧洲语言(英语、德语、法语、意大利语和西班牙语)的跨域推理轨迹大规模并行语料库,每种语言有超过 200 万个对齐样本,每个样本都包含提示、推理轨迹和最终输出,从而能够直接监督特定语言的推理。 (ii) 使用 ReasonXL,我们证明 LLM 可以完全适应所需目标语言的推理,使用监督 微调 (SFT) 的简单两阶段管道,然后是具有可验证奖励的强化学习 (RLVR)。由此产生的模型匹配或超过基线性能,一般知识的损失最小,并且广泛保留了跨语言迁移。 (iii)我们对适应进行了广泛的代表性分析,并发现了跨模型深度的清晰功能划分:早期层包含因果决定语言身份的激活瓶颈,而上层集中了由适应驱动的权重和激活变化。我们进一步发现,与 SFT 相比,RLVR 通过更小的参数更新实现了与基本模型更大的行为差异,这表明尽管权重更新小得多,但表征重新路由更有效。