论文

前向传播域适应(无跨层反向传播)

Forward Pass Domain Adaptation (Without Cross-Layer Backpropagation)

模型训练参数高效训练

摘要

仅前向传递 MLP 训练 (FPO) 采用 大语言模型,无需向后传递模型主体,在峰值训练内存减少约 40% 的情况下实现标准 微调 吞吐量的 2.7--3.2 倍,同时将域外基准保留在基线的种子噪声内,这是全网络 微调 无法可靠再现的属性。 FPO 依赖于单一的经验观察:在 Transformer 的后期层,输出层预测误差在我们调查的六个公共模型中以余弦相似度 0.47--0.59 逼近真实梯度。我们引入了一个两分钟的诊断,可以量化任何模型每层的近似值,从而确定后期层适应的可行性。根据诊断信息,FPO 在输出处计算单个误差信号,并将其应用到每个目标层。层与层之间没有信号传播,并且在任何点都不会构建自动梯度图。我们在三个模型系列(OLMo-2-7B、Qwen3-8B、Falcon3-7B)上评估 FPO。在这三者中,FPO 都产生了域内困惑度的改善,并将 MMLU、ARC-Challenge、HellaSwag 和 Winogrande 留在基线的种子噪声范围内。将 SFT 本地化到 FPO 的目标层以进入该状态也是可行的,但成本是 FPO 的 2.2 倍。