论文

后训练如何改变多语言推理?

What Does Post-Training Change in Multilingual Reasoning?

模型评测鲁棒性、公平性与可信度评测

摘要

开源推理模型提供了跨语言推理能力的不平等访问。当模型可以解决问题但无法用用户的语言提供完整的解决方案时,语言就成为访问障碍而不仅仅是性能变化的根源。我们以 11 种语言审核 Qwen3 竞赛数学任务的检查点。在 10 种非英语语言中,在 16 个样本中,只有 15.4-17.9% 的问题得到了正确的、具有可见推理的终止解决方案,而英语中的这一比例为 92.9%。为了确定这种差异的根源,我们评估了一个模型系列的 13 个端点,涵盖已发布的检查点、两个尺度的多语言监督微调 (SFT)、受控 SFT 消融和三种强化学习 (RL) 奖励公式。我们共同跟踪正确性、语言遵守情况、终止和交付效率。主要瓶颈在后训练阶段发生变化。发布的模型通常用英语推理。多语言 SFT 恢复了目标语言推理,但在多语言、纯英语和单语言 SFT 运行中准确性下降,这表明这种成本并不是多语言混合所特有的;非英语推理轨迹还容易出现非终止循环。强化学习可以在不影响准确性的情况下让两个实验分支都恢复正常终止,但只有奖励包含语言项的分支才能用目标语言交付:仅奖励正确性即可将模型返回英语。这些阶段共同建立了一条可实现的后训练路径,从以英语为中心的能力到可靠交付的多语言推理。