论文
解释数据混合缩放定律
Explaining Data Mixing Scaling Laws
摘要
最近的研究建立了经验缩放定律来预测多域数据混合的模型性能。然而,对这些模型损失行为的理论理解仍然缺乏。在这项工作中,我们提出了一个统一的框架来解释数据混合的底层机制。我们的方法将最初为标准神经尺度定律(例如 Kaplan 和 Chinchilla)开发的理论视角扩展到多域设置。基于域在基本技能上重叠而在专业技能上存在差异的分布假设,我们确定了控制在不同数据混合物上训练的模型的域损失的两个关键因素:\textit{容量竞争},其中有限模型容量的分配在全局范围内耦合域损失;和\textit{噪声减少},其中最佳权重转向较难学习的域以最小化总体噪声。实证评估表明,我们的框架通过用较低的平均相对误差拟合损失景观并识别性能更高的训练混合物,优于现有基线。最重要的是,我们的模型成功地跨尺度进行推断,使用适合较小尺度的参数来预测大型、不可见尺度的高效混合物。此外,与之前的经验法则相比,我们的模型使用明显更少的参数来实现这些结果。我们的代码可在 https://github.com/meiqwq/Explaining-Data-Mishing-Scaling-Laws 获取。