论文

重新思考本地学习:LLM 后训练 的更便宜、更快的方法

Rethinking Local Learning: A Cheaper and Faster Recipe for LLM Post-Training

模型训练参数高效训练

摘要

LLM 后训练 通常将任务梯度传播到模型的整个深度。尽管这种端到端结构简单且通用,但它将任务适应与全深度激活存储、远程后向依赖以及对预训练表示的直接任务梯度访问结合起来。我们认为,这种全深度反向耦合可能会不必要地昂贵且具有侵入性,特别是当 后训练 监督比 预训练 窄得多时。为此,我们提出 \textbf{LoPT}:本地学习 后训练,一种简单的 后训练 策略,使梯度达到明确的设计选择。 LoPT 在 Transformer 中点放置单个梯度边界:后半部分块从任务目标中学习,而前半部分块通过轻量级特征重建目标进行更新,以保留有用的表示并保持接口兼容性。 LoPT 缩短了任务引起的后向路径,同时限制了窄任务梯度对早期层表示的直接干扰。大量实验表明,LoPT 凭借更低的内存成本、更高的训练效率和更好地保留预训练能力,实现了具有竞争力的性能。我们的代码位于:https://github.com/HumyuShi/LoPT