论文
预测性批调度:通过损失感知样本优先级加速语言模型训练
Predictive Batch Scheduling: Accelerating Language Model Training Through Loss-Aware Sample Prioritization
摘要
我们提出预测性批调度(PBS),一种新的训练优化技术,通过在批构建时动态优先高损失样本来加速语言模型收敛。不同于需要预定义难度指标的课程学习方法,也不同于需要昂贵逐样本损失跟踪的难例挖掘方法,PBS 采用在线训练的轻量线性预测器,从静态词元级特征估计样本难度。预测器仅用四个简单特征——词元频率、序列长度、词汇多样性和稀有词元比例——就取得与实际损失 0.44 的相关性。在 130M 参数 transformer 上的实验表明,PBS 以各训练检查点的评估损失衡量实现快 6-13% 的收敛,预测器相关性在 10,000 训练步内从 0.14 提高到 0.44。这些结果验证了词元频率统计编码了关于样本难度的有意义信息,能以可忽略的计算开销实现有效课程学习。