论文

QVAC Genesis III:面向高效语言模型预训练的大规模开放合成STEM语料

QVAC Genesis III: A Large-Scale, High-Quality Open Synthetic STEM Corpus for Efficient Language Model Pre-Training

模型训练合成数据

摘要

高质量预训练数据是教育及STEM专用语言模型的关键瓶颈,尤其是在token预算严格受限的边缘AI和设备端部署场景。大型机构用私有语料训练越来越大的模型,但开放生态缺少能够为小模型高效提供高单token学习价值的STEM合成数据集。为弥补这一空缺,我们提出QVAC Genesis III:包含1914.3亿token、覆盖19个领域以及多个难度层次和不同教育风格的STEM多领域合成语料。其采用双重生成策略,以较弱的边缘规模学生模型作为信号来开展定向教师蒸馏:学生的失败被转换为纠错解释,成功则被扩展为针对所有答案选项的选项级对比推理。我们还提出以大语言模型为解析器的评估协议,从自由形式输出中提取最终答案,同时跟踪准确率与答案有效性。为验证数据效果,我们用17亿参数模型开展受控的从零训练消融实验,显示使用QVAC Genesis III训练的模型在ARC、GPQA Diamond和MMLU STEM上持续优于使用开源合成语料Cosmopedia-v2训练的模型及公开发布的Cosmo-1B模型;ARC-E提升最高达28.57%,ARC-C最高达21.35%,有效答案率最高达99.45%。

QVAC Genesis III:面向高效语言模型预训练的大规模开放合成STEM语料:论文配图
图 1:双方法合成数据生成管道概述。种子段落经过质量过滤,转换为 MCQ,由学生模型回答,并通过 LLM-as-a-parser 提取进行解析。正确答案将被路由至选项级 (OL) 推理;不正确或不可提取的答案将被发送到故障分析 (FA)。详细信息请参见第 3 节。