论文

参数效率不是内存效率:重新思考 微调 用于设备上 LLM 适配

Parameter Efficiency Is Not Memory Efficiency: Rethinking Fine-Tuning for On-Device LLM Adaptation

模型训练参数高效训练

摘要

高效参数 微调 (PEFT) 已成为适配 大语言模型 (LLM) 的标准。在这项工作中,我们挑战了参数效率等同于内存效率和设备适应性的广泛假设。我们证明事实并非如此——虽然 LoRA 和 IA3 等方法显着减少了可训练参数,但它们仍然受到随序列长度线性缩放的中间张量的约束,通常会触发设备上的内存不足错误。在这项工作中,我们引入了 LARS(低内存激活秩子空间),这是一种新颖的适应框架,可将内存消耗与序列长度解耦。之前的 PEFT 方法对模型参数应用低秩约束,而 LARS 则限制训练期间使用的激活子空间,直接针对内存消耗的主要来源,从根本上压平内存增长率。与 LoRA 相比,LARS 使用不同模型进行推理、理解和长上下文数据集时,GPU 上的内存占用平均减少了 33.54%,CPU 上的内存占用平均减少了 51.95%,同时保持了有竞争力的准确性和吞吐量。除了 GPU 之外,我们还部署在 Raspberry Pi 和消费级 CPU 上,以证明 LARS 为资源受限的硬件和边缘设备上的复杂 LLM 个性化提供了可扩展的路径。