论文

IKS-Instruct:用于教学语言模型印度知识系统的 24,000 个示例多语言数据集

IKS-Instruct: A 24,000-Example Multilingual Dataset for Teaching Language Models Indian Knowledge Systems

模型训练合成数据

摘要

指令调优已成为使 大语言模型 遵循人类意图的标准方法,但现有的指令数据集以英语通用知识任务为主,缺乏对专业教学领域的覆盖。本文介绍了 IKS-Instruct,这是一个包含 24,795 个指令-响应对的数据集,用于教授语言模型,以提供基于印度知识系统 (IKS) 的教育内容。该数据集涵盖七种语言(英语、印地语、梵语、泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语),涵盖吠陀口语和数学传统的 41 种教学技术,并与中央中等教育委员会 (CBSE) 6 至 12 年级课程保持一致。这些对源自六种来源类型:古典文本语料库(薄伽梵歌、Thirukkural、Sangam 文学、吠陀文本)、与课程一致的教学模板、吠陀数学佛经演示、双语教学对、基于技术的多轮对话和跨传统比较分析。质量通过多评委评估框架进行评估,其中独立语言模型对 12 个维度的反应进行评分,包括技术保真度、教学质量、事实准确性和 IKS 文化深度。在统一的五名评委外部小组(超过 1,201 个分层项目的中值聚合)下,紧凑 7B 模型的最强 IKS-Instruct 微调达到了 6.39 的中值评委分数,与强大的通用参考模型(Nemotron-Nano 为 6.54)的差距在 0.15 以内,而部署成本仅为其一小部分,而没有 IKS 微调 的基本模型在IKS 特定尺寸。模型质量不会随着数据管理而单调增加,我们将结果与相应的数据质量收益一起报告。