论文
MIRA:面向来源感知数据选择的中间训练量规锚定
MIRA: Mid-training Rubric Anchoring for Source-Aware Data Selection
摘要
中间训练(mid-training)已成为现代LLM开发的重要阶段,在最终后训练之前使用大规模策划的混合数据来增强能力。它的数据选择问题独具特点:数据在接近预训练的规模下按预训练式目标进行优化,但却是朝下游能力方向策划的,并来自格式与训练角色各异的异构来源。因此,有效的选择既需要可扩展性,也需要来源自适应的语义准则。现有基于模型的方法扩展性好,但只提供隐式的质量信号。语义选择方法能给出更强的判断,但通常假设固定的量规(rubric)或标准化的数据格式。为解决这一错配,我们提出MIRA,一个基于自锚定量规发现的来源感知过滤框架。其核心思想是把量规构建变成数据选择的一部分:MIRA先为每个来源组发现应评估什么,再将这些判断蒸馏为可扩展的学生评分器,用于全语料库过滤。在包含21个来源与5个来源组的面向代码的中间训练中,MIRA在九个代码基准上优于各选择基线,并仅用一半token便追平全语料库运行的效果。
