论文

CausalMix:数据混合作为语言的因果推理 模型训练

CausalMix: Data Mixture as Causal Inference for Language Model Training

模型训练合成数据

摘要

在大语言模型(LLM)训练中,数据混合在决定模型性能方面起着关键作用。最近的方法通过代理模型优化混合权重,但它们依赖于静态数据分布的假设。因此,当底层数据池发生变化时,这些方法需要从头开始进行昂贵的重新训练。这一限制限制了它们从小设置无缝扩展到更大数据池和模型大小的能力。在本文中,我们提出 CausalMix 通过将数据混合优化作为因果推理问题来解决这一限制。我们将数据池的统计特征表示为协变量,将域混合表示为处理。在 Qwen2.5-0.5B 的 512 次运行上拟合因果模型以估计条件平均治疗效果 (CATE) 后,我们推断出 800K 数据池的最佳混合物,并将其应用于训练 7B 模型。此外,我们成功地将框架推广到 Qwen3-4B-Base 上的长链思想数据。通过利用因果建模来隔离混杂偏差,CausalMix 动态推断与状态相关的最佳数据混合。大量实验表明,CausalMix 引导的混合持续提高了多个下游任务的性能,优于 RegMix 和其他基线。此外,我们使用 CATE 解释器对学习的混合策略进行可视化分析。总体而言,CausalMix 提供了一个用于优化 LLM 数据混合的因果且可解释的框架。