论文

GLAN-QnA-KR:无种子分类驱动的韩语教学语料库

GLAN-QnA-KR: A Seedless Taxonomy-Driven Korean Instruction Corpus

模型训练合成数据

摘要

我们发布了 GLAN-QnA-KR,这是一个 303,581 行公开可再分发的韩语指令 QA 语料库,通过无种子分类驱动的 GLAN 合成管道生成,并以 Microsoft 的 Phi-3.5-MoE-instruct 作为生产者模型(生成:2024 年 12 月;发布:2024 年 12 月;许可证:OpenRAIL)。该语料库涵盖 1,084 个英文标记的学科与韩语问答文本的平面分类,难度等级为 100-900,每条记录的中位数为 313 个问题字符和 1,098 个答案字符。对于这种规模的合成指令数据来说,有两个属性是非典型的:(i) 303,581 行中精确重复的问题数仅 1 个,而 Jaccard >= 0.9 的字符三元组近重复簇在 5,000 个样本探测中为零,以及 (ii) 针对 KMMLU、KoBEST(五个子任务)和 HAE-RAE-Bench 的两层污染审计显示了最大测试与语料库问题级别在 20,000 个采样的 GLAN 问题和七个评估集上,字符三元组 Jaccard 为 0.163,Jaccard >= 0.7 处的测试项目为零,最大多语言 E5 余弦为 0.901,其中余弦 >= 0.90 的单个测试项目和 >= 0.95 的零测试项目。据我们所知,在发布时,这是 Hugging Face Hub 上可验证的最大的单管道合成韩语指令语料库,也是在无种子分类驱动协议下构建的唯一 >=10 万行的韩语语料库。本说明以适合下游引用的形式记录了生成协议、语料库统计、污染审计和许可边界。