论文

构建多语言桥梁:数据混合作为语言内推理泛化的支柱

Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning

模型训练监督微调与指令调优

摘要

推理语言模型在各种复杂任务上取得了实质性进展,但它们的功能仍然绝大多数以英语为中心:模型主要以英语进行推理,无论提示的语言是什么。这对于非英语用户来说是无法访问的,有可能失去原始问题的意图,并且放弃更容易用目标语言表达的知识。在这项工作中,我们推进了 L2 推理,即模型以用户提示的语言进行一致推理的能力,从而在提示和答案之间建立了语言桥梁。我们从以数据为中心的角度来解决这个问题,研究如何优化 SFT 中的数据组合和调度以实现推理泛化。在构建 3.35B 规模的 Tiny Aya L2-Thinker 时,我们在数学、常识推理、指令遵循、开放式生成和文化推理等 6 个基准测试中,在 60 种语言中实现了 93% 以上的 L2 推理率,同时保持了强劲的性能。我们展示了将 L2 推理推广到保留语言的路径,包括更广泛的语言覆盖范围、现成的多语言非推理数据和足够的英语推理骨干。这些发现表明,推理是一种与语言无关的行为,可以通过仔细的数据混合在不同类型的语言之间转移,并且不需要在每种目标语言中进行推理监督。我们发布模型权重和多语言推理数据,以支持可访问的语言推理的进一步研究。