论文

二次模型的辩护

A Defense of the Quadratic Model

模型评测模型行为与机制分析

摘要

由于神经网络损失情况的复杂性,优化理论被迫依赖于理想化模型,并且通常在模型理论上的易处理性与其描述真实优化动态的准确度之间进行权衡。在这项工作中,我们对最简单的优化模型(二次模型)进行了压力测试,并表明它在具有 150M 参数和 3B 训练词元的 LLM 设置中可以令人惊讶地进行预测。具体来说,我们表明泰勒通过训练扩展模型和中间检查点的损失函数可以准确预测可以持续高达 10% 训练的窗口上的优化动态。达成一致后,我们将通过两个视角来分析这些局部二次优化问题的结构:Hessian 谱和局部稳定性。使用带有极深探针的 Lanczos 求积,我们能够估计尾部深处的 Hessian 谱,并且我们在特征值和特征向量中发现了数量惊人的结构,这取决于批量大小、预处理器和训练时间。我们还根据经验测试了中间检查点的局部线性稳定性,并将其与理论预测进行比较,以证明 LLM 中的优化通常发生在稳定性的随机边缘,其性质也由批量大小决定。我们的结果表明二次模型可能是理论上易于处理的预训练优化动态代理。