论文

DataFlex:大语言模型 以数据为中心的动态训练的统一框架

DataFlex: A Unified Framework for Data-Centric Dynamic Training of Large Language Models

AI 基础设施数据基础设施

摘要

以数据为中心的训练已成为改进 大语言模型 (LLM) 的一个有前途的方向,它不仅优化模型参数,还优化优化过程中训练数据的选择、组成和加权。然而,现有的数据选择、数据混合优化和数据重新加权的方法通常是在接口不一致的孤立代码库中开发的,阻碍了可重复性、公平比较和实际集成。在本文中,我们提出了 DataFlex,这是一个基于 LLaMA-Factory 构建的、以数据为中心的统一动态训练框架。 DataFlex支持动态数据优化的三大范例:样本选择、域混合调整和样本重新加权,同时保持与原始训练工作流程完全兼容。它提供可扩展的训练器抽象和模块化组件,可直接替代标准 LLM 训练,并统一关键的模型相关操作(例如嵌入提取、推理和梯度计算),并支持包括 DeepSpeed ZeRO-3 在内的大规模设置。我们对多种以数据为中心的方法进行了全面的实验。在 Mistral-7B 和 Llama-3.2-3B 上,动态数据选择始终优于 MMLU 上的静态全数据训练。对于数据混合,当在 SlimPajama 上以 6B 和 30B 词元规模预训练 Qwen2.5-1.5B 时,DoReMi 和 ODM 比默认比例提高了 MMLU 准确性和语料库级别的困惑度。 DataFlex 还比原始实施实现了一致的运行时间改进。这些结果表明,DataFlex 为 LLM 以数据为中心的动态训练提供了有效、高效且可重复的基础设施。