论文
AFRILANGTUTOR:通过 大语言模型 推进低资源语言的语言辅导和文化教育
AFRILANGTUTOR: Advancing Language Tutoring and Culture Education in Low-Resource Languages with Large Language Models
摘要
对于缺乏足够训练资源的语言,如何开发语言学习系统?非洲大陆的开发人员越来越多地面临这一挑战,他们的目标是构建能够理解当地语言并做出响应的人工智能系统。为了弥补这一差距,我们引入了 AFRILANGDICT,这是一个包含 194.7K 非洲语言-英语词典条目的集合,旨在作为生成语言学习材料的种子资源,使我们能够自动构建适合训练人工智能辅助语言导师的大规模、多样化且可验证的学生与导师问答交互。使用 AFRILANGDICT,我们构建了 AFRILANGEDU,这是一个包含 78.9K 多轮训练示例的数据集,用于监督 微调 (SFT) 和直接偏好优化 (DPO)。我们使用 AFRILANGEDU 训练语言辅导模型,统称为 AFRILANGTUTOR。我们在 AFRILANGEDU 上对 10 种非洲语言的两种多语言 LLM:Llama-3-8B-IT 和 Gemma-3-12B-IT 进行了微调,并评估了它们的性能。我们的结果表明,在 AFRILANGEDU 上训练的模型始终优于其基础模型,并且结合 SFT 和 DPO 产生了显着的改进,在 LLM 法官评估的四个标准下,收益范围为 1.8% 到 15.5%。为了促进对低资源语言的进一步研究,所有资源均可在 https://huggingface.co/afrilang-edu 上获取。