让数据决定:《续 预训练》中的监督分析、能力权衡和自适应目标路由(通过 离策略 蒸馏)
Let the Data Decide: Supervision Analysis, Capability Trade-offs, and Adaptive Objective Routing in Continued Pre-Training via Off-Policy Distillation
摘要
离策略 蒸馏 现在是 大语言模型 预训练 的核心,但训练数据、目标参数化和模型功能如何交互的特征仍然很少。我们通过将这个问题分解为两个问题来研究 top-$k$ 截断、温度缩放的 离策略 蒸馏:对训练目标如何塑造 词元级 监督和下游性能的 \emph{objective-to-capability} 分析,以及对数据异构性如何影响目标路由的 \emph{data-to-objective} 分析。我们首先表明,语言建模目标($L_{\mathrm{LM}}$)和知识蒸馏目标($L_{\mathrm{KD}}$)会导致系统性不同的能力概况,并将这种分歧追溯到\emph{直接观察到的词元强化}和\emph{教师支持的替代监督}之间的梯度水平张力。为了量化这种张力,我们引入了诊断指标——支持覆盖率、观察到的词元概率质量和教师分布集中度——并通过受控扫描显示支持大小 $k$ 控制覆盖范围-锐度权衡,而 蒸馏 温度控制支持内概率分配。然后,我们检查自适应目标路由:将 $L_{\mathrm{LM}}$ 应用于数学和代码并将 $L_{\mathrm{KD}}$ 应用于通用域数据的域级策略在两个单目标基线上产生一致的增益,而基于观察到的词元概率质量或教师熵的 词元级 路由无法一致地匹配单目标基线。这些结果表明,有效的目标路由较少依赖于路由粒度,而更多地依赖于路由信号的质量,通过 离策略 蒸馏 将继续 预训练 重新构建为结构化、数据条件监督设计问题,而不是全局超参数选择。