论文
通过渐进式语码转换实现高效的多语言推理迁移
Efficient Multilingual Reasoning Transfer via Progressive Code-Switching
摘要
大型推理模型(LRM)已经在英语中实现了强大的推理能力,但当需要用其他语言进行推理时,其性能会显着下降。一个自然的解决方案是将模型的英语推理能力转移到目标语言。然而,现有的迁移方法通常依赖于来自更强大的 LRM 的目标语言推理痕迹或来自外部判断模型的在线监督,这些方法成本高昂且难以扩展。在本文中,我们提出了 PCS(渐进式代码切换),这是一种更高效的传输框架,只需要轻量级翻译,无需任何更强的 蒸馏 模型或判断。 PCS 首先通过将英语推理步骤的子集翻译成目标语言来构建语码转换推理轨迹,并使用它们通过监督 微调 来初始化模型的语码转换能力。然后,它通过阶梯式语言一致性课程应用强化学习,逐步提高目标语言比率,直到模型完全用目标语言进行推理。这种渐进式设计提供了平滑的传输路径,避免了直接执行目标语言推理时常见的不稳定和性能下降。对多个基准和五种类型不同的语言进行的实验表明,PCS 大大缩小了目标语言和英语推理之间的性能差距,在保持有竞争力的准确性的同时产生更多语言一致的推理。