论文

用低资源语言思考:SFT 构建什么、RL 修复什么、准确性看不到什么

Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See

模型评测模型行为与机制分析

摘要

采用三个前沿专家混合模型(阿里巴巴、OpenAI、NVIDIA;每个模型都有 3.6-4.0B 的活动参数),并对它们进行微调,以用低资源语言进行推理。在准确性基准测试中,几乎没有任何反应,而且基准测试本身在这种规模上就是噪音:仅更改随机种子,得分就会提高 7.7 分,比我们测量的所有数据和配方效果都高。这个 null 是我们的第一个结果。真正的变化存在于准确性无法看到的地方。基本模型从不用希腊语思考:即使问题是希腊语,1,000 个推理轨迹中也只有 0 个,因此模型在以用户无法阅读、审核或更正的形式进行推理时正确回答。在监督 微调 (SFT) 后,每个发布的检查点都用问题语言对大约 98% 的项目进行推理,一个系列的标记减少了 3 倍,所有四个模型的语法判断都得到了改善,每个基础的一般能力都在几个点内:没有忘记任何东西,并且获得了流畅性。我们提出了六个行为维度,使这些变化可测量,每个维度都拒绝与输出长度相关的任何度量,并且我们报告了我们自己的仪器如何撒谎:六次失败,每次都被控制捕获。 SFT 不能做的是修复其自身的缺陷:四分之一的答案跳过了所要求的格式,答案泄漏到推理通道中,并且只有不到一半的时间遵守明确的“用英语思考”。具有可验证奖励的强化学习,在训练前预先注册,彻底修复了前两个(回退 24% 到 2.5%,泄漏 3.5% 到 0.0%,均针对平坦随机奖励控制)并移动了第三个(+9.1pp),而希腊推理习惯在仅精度梯度中保持不变。我们释放了五个检查点。仪器、控件和预注册可支持任何资源匮乏的语言;希腊语就是这样让我们衡量它们的。