论文

摊销联邦适配:超网络驱动LoRA用于个性化

Amortizing Federated Adaptation: Hypernetwork Driven LoRA for Personalized Foundation Models

模型训练参数高效训练

摘要

使用低秩适应 (LoRA) 的基础模型联合微调为分布式学习提供了一种高效通信的解决方案。然而,现有的联合 LoRA 方法存在两个基本限制:(1) 结构聚合偏差,其中独立平均低秩因子无法近似真实的组合更新;(2) 客户端初始化滞后,因为客户端在通信轮次中重复重新初始化 LoRA 参数,从而减慢收敛速度。我们提出了 HyperLoRA,这是一个统一的框架,通过超网络驱动的 LoRA 生成和产品空间聚合进行摊销联合适应来解决这两个问题。 HyperLoRA 采用学习生成器,将客户端分布签名映射到 LoRA 初始化,而不是针对每个客户端进行迭代优化,从而有效地分摊每个客户端的适应情况。在服务器端,我们引入了一个学习聚合模块,该模块直接合成低秩乘积空间中的更新,消除了逐因子平均的不一致问题。轻量级残差校正模块进一步提高了异构(非 IID)客户端分布下的稳定性。通过用学习算子取代迭代优化和启发式平均,HyperLoRA 共同实现了高效的个性化、无偏聚合和更快的收敛。联合视觉和视觉语言基准的实验表明,与之前的联合 LoRA 方法相比,HyperLoRA 实现了更高的收敛速度、对分布变化的更强鲁棒性以及更强的个性化性能。

摊销联邦适配:超网络驱动LoRA用于个性化:论文配图
图 1:HyperLoRA。每个客户端从其私有数据集中提取低维分布签名 𝒔i\bm{s}_{i} 并将其提供给共享超网络生成器 GphiG_{\phi},后者生成个性化 LoRA 初始化 (𝑨i0,𝑩i0)(\bm{A}_{i}^{0},\bm{B}_{i}^{0})。经过局部优化的 EE 步骤后,上传生成的低秩因子 (𝑨i,𝑩i)(\bm{A}_{i},\bm{B}_{i})。服务器不是独立平均会产生结构偏差的因素(第 3.2 节),而是应用学习合成器 SψS_{\psi},该合成器直接在乘积空间 𝑩​𝑨\bm{B}\bm{A} 中运行,然后是残差校正器 CωC_{\omega},用于补偿严重异质性下的低秩投影误差。