论文

光谱紧凑训练:预训练 大语言模型 通过永久截断 SVD 和 Stiefel QR 回缩

Spectral Compact Training: Pre-Training Large Language Models via Permanent Truncated SVD and Stiefel QR Retraction

模型训练参数高效训练

摘要

内存墙仍然是在消费类硬件上训练 大语言模型 的主要瓶颈。我们引入了谱紧凑训练 (SCT),这是一种用永久截断 SVD 因子 W = U diag(s) V^T 替换稠密权重矩阵的方法,其中完整稠密矩阵在训练或推理过程中永远不会具体化。梯度通过标准反向传播流经紧凑谱因子,并且在每个优化器步骤之后通过 QR 分解将 U、V 退回到 Stiefel 流形。 SCT 在第 32 级时将每个 MLP 层的内存减少高达 199 倍,从而在 Steam Deck 手持设备上实现 70B 参数架构的完整训练步骤(7.2 GB 峰值内存与使用 Adam 进行密集 FP32 训练的 1,245 GB)。 SmolLM2-1.7B(秩 32-256,2000 步,NVIDIA A100)上的秩扫描实验表明,所有测试的秩都收敛到相同的损失层(~4.2-4.5),将学习率计划(而不是 MLP 秩)确定为主要瓶颈。 Rank 128 成为 11.7 倍 MLP 压缩的效率最佳点,且困惑度最低。在第 32 级时,GPU 内存下降了 46%,而训练吞吐量却翻了一番。