论文
DECA:去中心化 Block-Wise Adam,在非 IID 数据上实现高效 LLM 全参数 微调
DECA: Decentralizing Block-Wise Adam for Efficient LLM Full-Parameter Fine-Tuning on Non-IID Data
摘要
微调 大语言模型 (LLM) 在隐私敏感和资源受限的环境中仍然具有挑战性。由于训练数据通常分布在多个客户端,分散式 微调 为无需中央服务器的协作适应提供了自然范例。然而,在这种去中心化的环境中启用全参数 微调 (FPFT) 是很困难的:FPFT 提供了强大的适应能力,但对于数十亿规模的模型来说会产生令人望而却步的资源消耗。因此,现有的去中心化 LLM 微调 方法主要依赖于参数有效的更新,这提高了效率,但可能会限制下游性能。此外,客户端数据通常是非独立同分布的,使得去中心化优化更容易受到客户端漂移和不稳定收敛的影响。为了应对这些挑战,我们提出了 DECA,这是一种针对非 IID 数据上的 LLM 的资源高效型去中心化 FPFT 框架。 DECA 将模型参数划分为不相交的块,并执行顺序块级 Adam 优化,减少资源消耗,同时保留分散的全参数自适应。为了稳定训练,DECA 进一步引入了一阶和二阶分块矩估计,以及新的局部梯度统计和共识导出的差异信号。我们提供了严格的理论分析和广泛的实验,表明 DECA 实现了快速收敛、强大的下游性能和显着的资源效率。