论文

Edu-QuRating:具有精炼成对判断的多维教育数据管理

Edu-QuRating: Multi-Dimensional Educational Data Curation with Distilled Pairwise Judgements

模型训练合成数据

摘要

教育数据过滤器已成为改进语言模型 预训练 的实用方法,但大多数过滤器将教育价值视为单个标量属性。对于某些应用程序来说,这可能过于宽泛,特别是如果数据集已经具有高密度的教育材料。有用的学习材料需要准确、引人入胜、结构良好,并且适合目标受众和应用(例如,面向学习者与面向教师)。继 QuRating(Wettig et al. 2024)之后,我们推出了 Edu-QuRating:多维教育数据评分和管理的管道。 Edu-QuRating 定义了特定于教育的评分标准,使用 LLM 法官来标记采样文档对,并将这些成对偏好提炼成可重复使用的 Edu-QuRaters,它可以根据一组教育标准对各个文本块进行评分。在两个序列分类基础模型和六种教育标准中,最好的 Edu-QuRater 恢复了保留的 GPT-4.1-mini 成对判断,平均准确度为 0.917。然后我们将所得的评分器应用到两个应用程序中。首先,我们研究了 Edu-QuRaters 在语料库过滤方面的潜力,以改善小语言模型的预训练。我们对 322.25M FineWeb-Edu-Fortified 文档进行评分,以获得过滤后的 预训练 混合物。在匹配的单次运行 预训练 比较中,使用基于 Edu-QuRating 的混合物训练的模型在九个基准上达到了比 FineWeb-Edu 基线更高的观察到的聚合准确度,并且收益集中在特定任务上。其次,我们使用 Edu-QuRater 分数作为 GRPO 后训练 的奖励条件。在配对评判评估中,结合 Edu-QuRater 和答案结构奖励,在教学质量和教学遵循方面产生了优于 Qwen3-4B 基本模型的反应。