论文

DLR:低秩 预训练 的零推理成本潜在残差

DLR: Zero-Inference-Cost Latent Residuals for Low-Rank Pre-Training

模型训练预训练

摘要

大语言模型 推动了语言和多模式人工智能的最新进展,但 预训练 的规模化成本却高得令人望而却步。低秩 预训练 将每个权重矩阵分解为 r 级乘积,以减少参数和 FLOP,这是一种很有前途的响应,但通常在质量上落后于全秩训练。我们提出了重复潜在残差(DLR),这是一种仅用于训练、无参数、可折叠的低秩 预训练 插件。 DLR 使用固定的结构化残差 alpha/sqrt(K) * Expand_K(z) 来增强标准低秩输出 Bz,该残差在输出中复制每个潜在坐标 K = ceil(d_out/r) 次。在 alpha 固定的情况下,DLR 每层添加零个可学习参数;训练后,它被吸收到封闭形式的上投影中,B* = B + alpha/sqrt(K) R^T,因此部署参数计数、FLOPs 和内存与底层低秩主干完全匹配。在从 60M 到 7B 参数的 LLaMA 模型中,DLR 在大多数设置下增强了低秩 预训练 的 C4 验证困惑度,在 130M 及以上时增益最明显;折叠检查点干净地转移到标准基准上受监督的 微调。