论文

CERSA:累积能量保持子空间适应以实现内存高效 微调

CERSA: Cumulative Energy-Retaining Subspace Adaptation for Memory-Efficient Fine-Tuning

模型训练参数高效训练

摘要

为了减轻与 微调 大型预训练模型相关的内存限制,现有的参数高效 微调 (PEFT) 方法(例如 LoRA)依赖于低秩更新。然而,此类更新无法完全捕获全参数 微调 中观察到的权重修改的排名特征,从而导致性能差距。此外,LoRA 和其他现有的 PEFT 方法仍然需要大量内存来存储全套冻结权重,这限制了它们在资源有限的环境中的效率。为了解决这些限制,我们引入了累积能量保留子空间适应(CERSA),这是一种新颖的 微调 范例,它利用奇异值分解(SVD)仅保留负责 90% 至 95% 光谱能量的主成分。通过从该主子空间导出的 微调 低秩表示,CERSA 显着减少了内存消耗。我们对不同规模和领域的 CERSA 模型进行了广泛的评估,包括图像识别、文本到图像生成和自然语言理解。实证结果表明,CERSA 始终优于最先进的 PEFT 方法,同时显着降低了内存要求。该代码将公开发布。