没有子空间可跟踪:低秩训练中的不可识别性和优化器状态
No Subspace to Track: Non-Identifiability and Optimizer State in Low-Rank Training
摘要
内存高效优化器(例如 GaLore)通过将梯度投影到每 T 步重新计算的 R 级子空间上来训练 大语言模型,假设该子空间是一个可以跟踪的缓慢漂移的对象。我们证明,除了一个小的可复制核心之外,不存在这样的物体。在同一步骤中从不相交的小批量中计算出的 top-r 子空间的两个估计值的不一致程度与相隔 T 个步骤计算出的估计值的不一致程度(最大弦距离 sqrt(2r) 的 0.73 与 0.74,在 Pythia-160M 中 r=128):每次刷新时的表观旋转主要由估计器噪声主导。这适用于从 70M 到 6.9B 参数的三个架构类别的四个模型系列,随着规模的扩大而增强,而在愿景 Transformer 中则更弱。 128 个方向中只有约 39 个方向可以在小批量中重现,并且平均无法恢复其余部分:在 N 倍平均下,梯度的谱尾收缩为 N^(-1/4) 而不是纯噪声的 N^(-1/2),因此没有平均预算可以很好地定义子空间。相反,将每次刷新视为 Adam 状态的坐标变化会有所帮助。盲目携带二阶矩可证明比最佳旋转盲估计器差约 (r-k*)/2,而一阶矩精确地通过旋转、各向同性梯度下的最佳线性映射和 LDAdam 使用的规则进行传输。在 1B 超过 40k 步骤(3 个种子)时,完整的 LDAdam 在 beta2=0.999 时达到 18.7 困惑度,在其最佳 beta2 修复(19.3)后击败未传输的 GaLore;将二阶矩记忆缩短至 beta2=0.99 有助于刷新优化器,尽管对于规范的 GaLore 来说效果很小,并且满秩控制会逆转它。一个可测量的事实,即子空间不可识别性,阐明了为什么 GaLore 有效、哪些补丁有效,以及在信任低秩假设之前要检查什么:可再现的秩 k*。