论文

RegMix-D:通过代理训练轨迹进行动态数据混合

RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories

模型训练合成数据

摘要

数据混合选择对于 大语言模型 预训练至关重要。 RegMix 等现有方法通过在小规模代理运行上拟合回归模型来选择单个静态混合物。我们提出 RegMix-D,这是 RegMix 对动态混合的简单扩展。我们的主要观察结果是,代理运行不仅会产生端点损失,还会产生完全损失轨迹,这可用于进一步改进数据混合。通过在这些轨迹上训练回归模型,我们可以在多个训练阶段预测最佳混合物。 RegMix-D 支持两种部署模式:离线变体在目标训练之前生成完整的混合计划,以及在线变体在训练期间使用观察到的损失来调整混合。对具有 1B 参数目标模型的 Pile 数据集的 25B 词元进行的实验表明,RegMix-D 在 13 个下游任务中持续优于 RegMix 和 DoReMi,同时保持代理效率:即使只有 128 个代理模型(RegMix 代理计算预算的 25%),它也超越了 RegMix。