论文

边缘设备上 LoRA 微调 或 LLM 的峰值内存减少技术

Techniques for Peak Memory Reduction for LoRA Fine-tuning of LLMs on Edge Devices

模型训练参数高效训练

摘要

大语言模型 (LLM) 的 微调 对最终用户的数据使用低秩适应 (LoRA),在保持数据私密性的同时提供个性化体验,但面临消费类硬件的严格内存限制。 微调 期间的峰值内存通常会超出设备限制,特别是对于具有数十亿个参数和长上下文训练数据的模型。本文介绍了一套互补技术,可在不牺牲模型质量的情况下减少内存占用:(1) 具有即时反量化功能的基本模型量化,(2) 结合选择性激活缓存和磁盘卸载的内存高效检查点,(3) 使用语义相关标记子集的 softmax 近似,以及 (4) logits 掩码。 Llama-3.2 3B 和 Qwen-2.5 3B 上的实验表明,峰值内存最多可减少 26\times$ 和 $28\times$,从而在资源受限的设备上启用 微调。