论文

论神经尺度定律的不变性和普遍性

On the Invariance and Generality of Neural Scaling Laws

模型评测模型行为与机制分析

摘要

神经缩放定律在模型性能与数据或计算之间建立了可预测的关系,为新领域和任务中的资源分配提供了重要指导。然而,这些法律恰恰在最难获得的地方最需要:为新模型任务对拟合一个法律需要昂贵的扫描,这通常会耗尽该法律旨在节省的计算预算。本文提出了如何开发可推广的缩放定律的研究问题:定律在资源丰富的源域上一次拟合,并可靠地传输到无法进行全面扫描的新域,这需要对缩放属性何时以及为何发生变化有基本的了解。我们通过识别正确的不变量来解决这个问题:缩放定律在数据的双射(信息保留)变换下得到保留,并在非双射变换下以可预测的、基于信息理论的方式进行修改,从而降低其信息分辨率$ρ$:沿着一个轴,适合一个域的定律可以传输到另一个域。我们在语言、视觉和语音方面验证了这一点,并演示了两个跨领域应用:根据适合一般文本的法律预测在电子健康记录上训练的语言模型的缩放比例,以及预测不同噪声注入水平下的时间序列分类缩放比例,将数据缩放指数恢复到 $3\%$ 误差范围内。