论文

超越困惑度:低秩预训练的几何与矩阵谱研究

Beyond Perplexity: A Geometric and Spectral Study of Low-Rank Pre-Training

模型评测模型行为与机制分析

摘要

预训练 大语言模型 主要由存储满秩权重、梯度和优化器状态的内存成本决定。低秩 预训练 的出现就是为了解决这个问题,并且方法的空间迅速增长。一个核心问题仍然悬而未决:低秩方法是否会产生与全秩训练相当的泛化模型,或者秩约束是否从根本上改变了所达到的解决方案?现有的比较几乎完全依赖于单种子运行的验证困惑度,通常是从先前的文献中继承而来。然而,困惑度并不能很好地代表解决方案的质量。两种方法可以匹配困惑度,同时收敛到不同的损失景观区域和内部表示。我们通过描述五种低秩 预训练 方法、GaLore 和 Fira(内存高效优化器)、CoLA 和 SLTrain(架构重新参数化)以及 ReLoRA(具有定期重置的适配器式更新)所发现的解决方案的特征来缩小这一差距,并针对三种模型规模(60M、130M、350M)的全秩训练。我们沿着四个维度的 16 个指标评估每个指标:沿随机/top-K PCA 方向的一维损失景观、检查点之间的一维插值、权重和学习更新的谱结构以及与全秩训练的激活相似性。我们表明,低秩方法并不等同于满秩训练,也不等同于彼此,即使验证困惑度很接近。全秩训练比低秩方法沿随机方向陷入更尖锐的盆地,而 top-1 PCA 方向则相反。每种方法都会收敛到一个几何上不同的盆地。随着训练的进行,低秩激活在后面的层中与全秩激活有所不同,其中 GaLore 跟踪全秩激活最为接近。此外,验证的困惑并不会转化为每个规模的下游性能。添加几何和矩阵谱度量可以改善预测。