论文

MIRA:面向来源感知数据选择的中间训练量规锚定

MIRA: Mid-training Rubric Anchoring for Source-Aware Data Selection

模型训练预训练

摘要

中间训练(mid-training)已成为现代LLM开发的重要阶段,在最终后训练之前使用大规模策划的混合数据来增强能力。它的数据选择问题独具特点:数据在接近预训练的规模下按预训练式目标进行优化,但却是朝下游能力方向策划的,并来自格式与训练角色各异的异构来源。因此,有效的选择既需要可扩展性,也需要来源自适应的语义准则。现有基于模型的方法扩展性好,但只提供隐式的质量信号。语义选择方法能给出更强的判断,但通常假设固定的量规(rubric)或标准化的数据格式。为解决这一错配,我们提出MIRA,一个基于自锚定量规发现的来源感知过滤框架。其核心思想是把量规构建变成数据选择的一部分:MIRA先为每个来源组发现应评估什么,再将这些判断蒸馏为可扩展的学生评分器,用于全语料库过滤。在包含21个来源与5个来源组的面向代码的中间训练中,MIRA在九个代码基准上优于各选择基线,并仅用一半token便追平全语料库运行的效果。

MIRA:面向来源感知数据选择的中间训练量规锚定:论文配图
图 1:MIRA 管道概述。异构的中期训练源首先被组织成能力一致的组。在每个组中,前沿法官会产生自由形式的判断,这些判断被聚集到一组固定的锚维度中(第 3.2 节)。这些锚点定义了一个稳定的评分空间,教师在其中对更大的样本重新评分,并且生成的结构化标签被提炼成在整个语料库上运行的特定于组的学生评分器(第 3.3 节)。然后,每个记录的学生输出在源条件可靠性掩码下聚合,该掩码抑制不可靠的源维度对(第 3.4 节),每个源保留阈值将聚合分数转换为最终选择,同时保留源多样性(第 3.5 节)。