论文
揭秘面向增强LLM训练的数据组织
Demystifying Data Organization for Enhanced LLM Training
摘要
大语言模型(LLM)已革新了众多领域,但其训练效率在很大程度上依赖于有效的数据策划。尽管数据选择已被广泛研究,面向增强训练的策略性数据组织仍是探索不足的领域,尤其当前LLM常常只训练一个或少数几个epoch。本文通过复用最初为数据效率而生成的预计算样本级分数,系统探索数据组织对LLM训练的影响,由此只带来极小的额外计算开销。我们识别并形式化了优化数据组织的四条关键准则:边界锐化(Boundary Sharpening)、循环调度(Cyclic Scheduling)、课程连续性(Curriculum Continuity)与局部多样性(Local Diversity)。在其指导下,我们提出两种新颖的数据排序方法,命名为STR与SAW。跨不同模型规模与数据规模、涵盖预训练与SFT阶段的大量实验验证了我们所总结准则的有效性。这些实验还证明了所提数据排序方法在提升LLM训练稳定性与性能方面的鲁棒性。GitHub链接:https://github.com/microsoft/data-efficacy/
