论文
LLM 作为噪声通道:模型容量和缩放定律的香农视角
LLMs as Noisy Channels: A Shannon Perspective on Model Capacity and Scaling Laws
摘要
大语言模型 (LLM) 的现有缩放定律(主要是单调幂定律)无法解释新兴的非单调现象,例如灾难性过度训练和量化引起的退化,尽管计算量增加,但性能仍会恶化。我们提出了香农缩放定律,这是一个统一的理论框架,将 LLM 训练建模为噪声信道上的信息传输,以香农-哈特利定理为基础。通过将模型参数映射到通道带宽并将训练标记映射到信号功率,我们的公式明确地捕获了学习信号和固有噪声之间的相互作用。这一观点揭示了 LLM 的基本香农能力:在不保留足够的信噪比 (SNR) 的情况下缩放模型大小或数据不可避免地会放大噪声,从而导致从单调改进过渡到 U 形性能下降。我们通过 Pythia 和 OLMo2 在扰动下的实验验证了我们的理论,包括高斯噪声、量化和数学、QA 和代码任务的监督 微调。香农缩放定律始终优于经典缩放定律和最近的扰动感知定律,实现了强大的 $R^2$ 分数,并准确捕获了先前方法遗漏的损失盆地。它还推断:在具有 $\leq$180B 词元的 $\leq$6.9B Pythia 模型上进行拟合,它预测未见过的 12B 模型在池化 $R^2{=}0.847$ 时最多有 307B 个词元,同时单调基线崩溃。