论文

跨语言 同策略 用于多语言推理的自我 蒸馏

Crosslingual On-Policy Self-Distillation for Multilingual Reasoning

摘要

大语言模型 (LLM) 在数学推理方面取得了显着的进步,但这种能力在不同语言之间并不相同。特别是低资源语言的推理性能要低得多。为了解决这个问题,我们提出了 Crosslingual 同策略 Self-蒸馏 (COPSD),它将模型自身的高资源推理行为转移到低资源语言。 COPSD 使用与学生和教师相同的模型:学生只看到资源不足的问题,而教师则获得特权的跨语言上下文,包括英语的问题翻译和参考解决方案。训练最大限度地减少了学生自己的部署的全分布 词元级 发散,提供密集的监督,同时避免仅结果强化学习 (RL) 的稀疏性和不稳定性。对 17 种低资源非洲语言进行的实验表明,COPSD 能够持续改进跨模型大小的低资源数学推理,并且大大优于组相对策略优化 (GRPO)。进一步的分析表明,COPSD 提高了答案格式的依从性,增强了测试时间的扩展,并推广到更难的多语言推理基准,尤其是对于资源较低的语言来说,收益尤其大。我们在以下位置提供代码和数据:https://github.com/cisnlp/COPSD。