论文
数据扩展作为预测贡献谱的渐进覆盖
Data Scaling as Progressive Coverage of a Predictive Contribution Spectrum
摘要
我们研究了这样一个假设:实际数据缩放定律是由潜在预测贡献谱的渐进覆盖范围决定的,而不是仅由词元频率尾部决定。我们使用文本语料库的后缀自动机表示,并定义数据内在的全局 KL 预测贡献谱,其中每个状态根据其经验质量乘以与全局下一个标记基线的 KL 偏差进行贡献。在 12 个真实语料库中,该谱的尾部斜率已经与固定小型 GPT 学习器的经验数据缩放指数密切相关。然后,我们超越斜率相关性,并通过将观察到的额外损失与准备好的 1000k 全局 KL 谱的残余尾部质量相匹配,为每个训练大小 N 定义有效截断秩 K(N)。根据经验,log K 与 log N 接近线性,原始频谱的合并 R^2 约为 0.96,平滑频谱的 R^2 约为 0.90。这些发现为简单的机制图景提供了强有力的实证支持:训练规模通过预测状态谱推进有效前沿,并且该谱的残余尾部质量跟踪剩余的超额损失。