论文
领域感知扩展法则揭示数据协同作用
Domain-Aware Scaling Laws Uncover Data Synergy
摘要
机器学习的进步通常归因于模型大小和数据集容量的扩展,但数据的组成也同样重要。经验研究结果反复表明,组合来自不同领域的数据集会产生不平凡的相互作用。例如,添加代码可以改善数学推理,而某些混合会引入干扰,从而降低模型性能。我们将这些效应统称为数据协同效应,其中多个领域的贡献超过或低于其单独贡献的总和。在这项工作中,我们形式化并量化了语言模型预训练中的数据协同作用。利用开放权重 LLM 和不同预训练混合物的观察变化,我们估计了直接域与基准的协同作用(一个域如何对另一个域的性能做出贡献)和二阶域-域协同(需要多个域同时出现的功能)。我们的框架提高了与领域无关的缩放法则的预测准确性,并恢复了稳定的协同估计。我们通过在预测的最优和预测的反最优混合物上训练模型来验证这些估计,并确认我们的协同估计正确地预测了性能排名。