论文
多语言思考,而不是更加困难:用于教授推理模型进行语码转换的数据高效框架
Think Multilingual, Not Harder: A Data-Efficient Framework for Teaching Reasoning Models to Code-Switch
摘要
推理能力的最新发展使 大语言模型 能够解决日益复杂的数学、符号和逻辑任务。有趣的是,虽然推理模型通常被训练来生成单语文本,但这些模型也被观察到可以进行语码转换(即混合语言)。先前的工作要么将语码转换视为不受欢迎的错误,试图通过修改输入提示或输出解码过程来控制语码转换,要么专注于语言、领域、任务和模型的狭窄子集。我们通过引入第一个语言和行为驱动的 微调 框架来解决这些差距,该框架用于识别 大语言模型 中有益的语码转换推理行为,并教导这些模型更有效地进行语码转换以进行推理。我们创建了语码转换推理 (CoRe) 语料库,其中包括 (1) 来自 15 个模型、18 种语言、10 个脚本和不同推理领域的 7k 条推理轨迹,提供了对潜在有用的语码转换行为的见解,以及 (2) 40 个精心策划的数据集,用于训练和评估六种干预措施,以改善跨三种模型和七种语言的推理中的语码转换,总共 120 个 微调 条件。在来自与语言/文化无关和特定评估的 80k+ 推理痕迹中,以英语为主的推理、语义上准确的语码转换以及更均匀的语言混合与正确答案呈正相关,而密集切换则与错误答案相关。此外,我们能够通过不直接演示语码转换的 微调 任务引发积极行为。我们的工作表明,小型但精心策划的数据集可以改变推理模型代码转换的方式,使我们能够从缺乏大规模推理数据的许多语言中获得推理的好处。