论文
通过层交换重新思考多语言推理差距
Rethinking the Multilingual Reasoning Gap with Layer Swap
摘要
最近的推理 大语言模型 产生了一个主要以英语为主的思想链 (CoT),即使在以非英语语言提示时也是如此。先前的研究表明,与允许模型在用输入语言回答之前用英语进行推理(以英语为中心的推理)相比,强制 CoT 保留在输入语言(本机推理)中会大大降低性能。然而,大多数对这种母语推理差距的研究都依赖于推理时间干预或有限的母语训练数据。我们在更大范围和可比监督下重新审视这种比较。我们构建了跨六种语言(英语、法语、德语、西班牙语、中文和斯瓦希里语)的长多语言推理数据集;在 Qwen/Qwen3-8B-Base 基础上对母语和以英语为中心的体系中的专家进行微调,并在数学、科学、常识和代码方面进行评估。在这种情况下,五种非英语语言的平均母语推理差距缩小至 1.9--3.5%,比之前报告的要小得多。本地专家的权重空间分析揭示了中间层中一致的 微调 更新和外层中的分歧。这指出了一个很大程度上与语言无关的推理核心,周围环绕着特定于语言的层。利用这种结构,我们引入了层交换:将英语专家更强的推理中间层转移到每个母语专家中,缩小五种非英语语言之间的大部分母语推理差距,同时保留目标语言的 CoT。我们发布所有模型和数据集。