论文

Riazi-8B:用于数学推理的乌尔都语 大语言模型

Riazi-8B: An Urdu Large Language Model for Mathematical Reasoning

模型训练监督微调与指令调优

摘要

最近的 LLM 展示了强大的数学推理能力,但现有的收益很大程度上依赖于以英语为中心的训练资源和基准。结果,在乌尔都语等低资源语言中,推理性能大幅下降,其中面向推理的数据集和适应模型仍然稀缺。乌尔都语缺乏面向推理的资源和适合多步骤数学问题解决的模型,限制了最新进展对乌尔都语用户的适用性。我们通过 Riazi-8B 解决了这一差距,Riazi-8B 是一种乌尔都语数学推理模型,通过两步适应过程开发,包括乌尔都语维基百科上的持续 预训练 和源自 GSM8K 的乌尔都语思想链数据上的监督 微调。我们根据现有的乌尔都语指令调整模型在 MGSM-Urdu 上评估 Riazi-8B。我们的结果显示答案正确性、推理质量、回答完整性和乌尔都语生成方面持续改进。我们的研究结果表明,将乌尔都语语言适应与以推理为重点的 微调 相结合是将数学推理能力扩展到低资源语言的有效策略。