论文

将数据混合视为混合实验:面向大语言模型预训练的响应面方法与最优设计

Data Mixing as Mixture Experiment: Response Surface Methodology and Optimal Design for Large Language Model Pretraining

模型训练预训练

摘要

数据混合是大语言模型预训练中的核心设计问题:给定固定的token预算,实践者必须决定为每个领域分配多少数据。近期基于代理(proxy)的方法通过在候选混合上训练小模型、拟合响应模型并使用该响应为更大规模训练选择混合来解决这个问题。我们展示这一工作流具有经典混合实验的结构。在这一视角下,数据领域是混合成分,token份额是成分比例,代理训练运行是实验设计点,验证损失定义了概率单纯形上的响应面。我们使用稀疏二阶Scheffé响应面模型发展这一形式化,并构建模型鲁棒的I-最优设计用于代理数据混合实验。以RegMix为实证案例研究,我们展示该框架如何既能解释观察到的混合响应,又能设计更高效的代理实验。Scheffé分析显示领域价值具有很强的关系性:几个在加性效应下较弱的领域通过成对交互变得有利,尤其是通过与网络衍生文本的组合。稀疏Scheffé模型跨模型规模保持混合排名,并在提供加性与交互效应显式分解的同时,与灵活的机器学习预测器保持竞争力。在一项根据观察到的代理训练响应校准的仿真研究中,模型鲁棒I-最优设计在移除约25%的原始代理运行后即可恢复相关的混合排序。这些结果表明,LLM数据混合不仅应被视为预测问题,还应被视为实验设计问题,其中代理混合本身可以被选择以提高统计效率。

将数据混合视为混合实验:面向大语言模型预训练的响应面方法与最优设计:论文配图
图2:来自稀疏二阶Scheffé模型的若干成对交互系数。蓝色单元格表示负系数,对应相对加性混合基线更低的拟合验证损失。红色单元格表示正系数,对应相对加性基线更高的拟合验证损失。白色或近白色单元格表示交互作用较弱或未被稀疏模型选中。