论文
Konkani LLM:针对资源匮乏的印度语言的多脚本指令调整和评估
Konkani LLM: Multi-Script Instruction Tuning and Evaluation for a Low-Resource Indian Language
摘要
大语言模型 (LLM) 在孔卡尼语等资源匮乏的语言环境中始终表现不佳。这种性能缺陷源于严重的训练数据匮乏,加上天城文、罗米语和卡纳达语正字法的高度文字多样性。为了解决这一差距,我们引入了 Konkani-Instruct-100k,这是一个通过 Gemini 3 生成的综合综合指令调优数据集。我们通过评估领先的开放权重架构(包括 Llama 3.1、Qwen2.5 和 Gemma 3)以及专有的闭源模型来建立严格的基线基准。我们的主要贡献包括开发 Konkani LLM,这是一系列针对区域细微差别进行优化的微调模型。此外,我们正在开发多脚本 Konkani 基准以促进跨脚本语言评估。在机器翻译方面,Konkani LLM 比相应的基本模型提供了一致的增益,并且在多种设置中具有竞争力并超越了专有基准