DomainPilot:域级损失引导的两阶段数据混合优化,实现高效语言模型 微调
DomainPilot: Domain-Level Loss-Guided Two-Stage Data Mixture Optimization for Efficient Language Model Fine-Tuning
摘要
大语言模型(LLM)的训练效果从根本上受到训练数据的质量和组成的限制。现有的动态数据调度方法在工业规模预训练和监督 微调 (SFT) 方面面临严重限制:数据选择会在 TB 级语料库上产生令人望而却步的 O(N) 成本,混合优化方案会引入严重的 I/O 瓶颈或需要训练辅助参考模型,样本级重新加权策略依赖于将噪声、难度和新颖性混为一谈的损失信号。我们提出了 DomainPilot,一个域级损失引导的两阶段数据混合优化框架。 DomainPilot 引入了 词元级 域丢失监控,可在训练期间捕获每个域的学习动态,而无需停止数据管道。基于这些信号,我们提出了一个缩放定律引导的粗优化阶段,该阶段适合特定领域的收敛曲线,并得出混合调整的原则性先验。随后的混合定律引导的精细优化阶段通过受控扫描实验对跨域相互作用效应进行建模来细化混合物。整个机制是通过基于补丁的架构实现的,该架构将领域感知损失计算注入到现有的训练框架(例如 MindSpeed/Megatron-LM)中,仅需要约 30 行特定于框架的适配器代码。我们在 SFT 期间在 Qwen3-1.7B 模型上验证 DomainPilot。与原始数据混合相比,我们的优化混合在 MMLU-Redux 上实现了 +2% 的改进,在 AIME24 上实现了 +1.8% 的改进,在 LiveCodeBench v5 上实现了 +3.8% 的改进,在 BFCL v3 上实现了 +3.6% 的改进,而没有增加总数据量或训练成本。这些结果表明,域级训练信号为昂贵的数据选择或用于混合优化的辅助 模型训练 提供了有效、轻量级的替代方案。