论文
数据混合什么时候可以改善缩放定律?高维回归的见解
When do data mixtures improve scaling laws? Insights from high-dimensional regression
摘要
现代机器学习系统接受来自不同领域的数据混合的训练,选择正确的混合可以显着提高下游性能。尽管有大量关于数据混合和重新加权的文献,但现有的工作很大程度上是经验性的,目前还不清楚辅助数据何时真正改善了缩放法则,而不仅仅是提供更多样本。为了深入了解这个问题,我们研究了一个高维混合数据回归模型,该模型具有共享回归函数、异构协方差和噪声水平以及可能以不同速率增长的数据集大小。我们为一般协方差结构建立了椭球参数约束下的极小极大风险,并推导了交换协方差下岭回归测试误差的确定性等价物。然后,我们专门研究具有对齐幂律协方差谱的目标域和辅助域,其中该理论在谱衰减、目标规律性和两个数据集的相对增长方面产生了明确的缩放定律。这些定律确定了组合数据混合物可比单独使用任一数据集产生更快的缩放率的机制。特别是,改进缩放定律需要光谱和域的相对样本大小之间的特定相互作用。我们对语言模型的数值实验表现出相同的定性现象:与单独在任一域上进行训练相比,适当的数据混合可以更快地降低目标域测试损失。