论文

ZeroLock:通过模块化更新解耦进行并发内存高效 LLM 训练

ZeroLock: Concurrent Memory-Efficient LLM Training via Modular Update Decoupling

模型训练参数高效训练

摘要

大语言模型 (LLM) 边缘的 微调 使模型适应特定于场景的数据,同时保护隐私。尽管现有研究提出管道并行性来解决边缘设备有限的内存和计算资源,但它们通常依赖于反向传播(BP)训练,这具有更新锁定的基本限制,并且可能会遇到严重的吞吐量和内存瓶颈。在这项工作中,我们提出了一种称为 ZeroLock 的无 BP 算法,该算法通过局部目标构造将模型更新解耦为独立的块更新。它打破了BP的更新锁定,因此可以提高算法级别的吞吐量,并通过减少激活存储来降低内存使用量。据我们所知,我们通过将局部目标映射到全局目标,为通用模型块划分下的基于局部目标构建的方法提供了第一个理论框架。我们证明 ZeroLock 的收敛速度为 $\tilde{\mathcal{O}}(1/\sqrt{T})$,与 BP 的区别仅在于多对数因子。我们为 ZeroLock 设计了一个系统,并构建了真实世界的原型,结合了早期转发和故障恢复等技术,以实现高效、稳健的实施。原型实验表明,与基于BP的基线相比,ZeroLock减少了26.5%的内存,提高了4.9%的吞吐量。