论文

FastMix:通过梯度下降快速优化训练数据配比

FastMix: Fast Data Mixture Optimization via Gradient Descent

模型训练合成数据

摘要

确定预训练与后训练的最佳数据配比仍是重要问题。FastMix在只训练一个代理模型的条件下自动搜索数据配比,同时优化混合系数和模型参数,避免依赖预设启发式或高成本模拟。框架把混合选择改写为双层优化,并证明在均匀采样数据源时,优化配比等价于为不同来源分配损失权重,从而将混合系数纳入可微迭代目标。近似优化过程交替执行两步:内循环按当前配比采样并更新模型参数,外循环根据验证反馈更新配比。在预训练与后训练实验中,FastMix优于基线,并显著降低搜索成本。代码:https://github.com/hrtan/fastmix。