论文

揭秘面向增强LLM训练的数据组织

Demystifying Data Organization for Enhanced LLM Training

模型训练预训练

摘要

大语言模型(LLM)已革新了众多领域,但其训练效率在很大程度上依赖于有效的数据策划。尽管数据选择已被广泛研究,面向增强训练的策略性数据组织仍是探索不足的领域,尤其当前LLM常常只训练一个或少数几个epoch。本文通过复用最初为数据效率而生成的预计算样本级分数,系统探索数据组织对LLM训练的影响,由此只带来极小的额外计算开销。我们识别并形式化了优化数据组织的四条关键准则:边界锐化(Boundary Sharpening)、循环调度(Cyclic Scheduling)、课程连续性(Curriculum Continuity)与局部多样性(Local Diversity)。在其指导下,我们提出两种新颖的数据排序方法,命名为STR与SAW。跨不同模型规模与数据规模、涵盖预训练与SFT阶段的大量实验验证了我们所总结准则的有效性。这些实验还证明了所提数据排序方法在提升LLM训练稳定性与性能方面的鲁棒性。GitHub链接:https://github.com/microsoft/data-efficacy/

揭秘面向增强LLM训练的数据组织:论文配图
图 1:不同数据组织策略的性能比较。底部:模型尺寸增加 (160M–1.7B) 下的平均准确度 (%)。我们提出的 SAW 在所有规模上始终优于随机学习和课程学习 (CL),在更高的容量下获得更大的收益。上图:按不同策略组织的训练数据的分数指数分布。与随机和 CL 相比,SAW 引入了更加结构化和渐进的评分模式,揭示了越来越有组织的课程。