论文

先压缩再适配?不,用任务感知子空间并集一起做

Compress Then Adapt? No, Do It Together via Task-aware Union of Subspaces

模型优化模型压缩

摘要

把大型预训练模型适配到多样任务已成常规,但参数高效微调(PEFT)与低秩压缩这两大主流策略通常被按序组合。这种解耦实践先压缩再微调适配器,可能使压缩子空间与下游目标错位,并浪费全局参数预算。为克服该局限,我们提出JACTUS(Joint Adaptation and Compression with a Task-aware Union of Subspaces),一个统一压缩与适配的单一框架。从小校准集出发,JACTUS估计输入与预激活梯度协方差,将其与预训练权重子空间做正交并集,在该并集内做投影低秩近似,按每参数边际收益全局分配秩,仅训练紧凑核心矩阵。这通过耦合「为压缩保留的方向」与「适配所需的方向」,显式缓解压缩子空间与下游目标的潜在错位,得到可部署的低秩模型:无需保留完整冻结权重,同时支持快速稳健调优。视觉上,JACTUS在保留80%参数下于八个数据集的ViT-Base平均89.2%准确率,超越强100% PEFT基线(如DoRA 87.9%);语言上,同等80%参数预算下Llama2-7B常识QA平均80.9%,超100% PEFT(DoRA 79.7%)及既往压缩再微调流水线。代码将发布。

先压缩再适配?不,用任务感知子空间并集一起做:论文配图
图 2:所提议的基于子空间的适应概述。 (a) 在校准集上估计激活和梯度协方差 𝐂x\mathbf{C}_{x} 和 𝐂g\mathbf{C}_{g}。 (b) 𝐔w,𝐕w,𝐔g,𝐕x\mathbf{U}_{w},\mathbf{V}_{w},\mathbf{U}_{g},\mathbf{V}_{x} 是通过对 𝐖\mathbf{W} 应用 SVD 获得的, 𝐂x\mathbf{C}_{x} 和 𝐂g\mathbf{C}_{g},然后按能量阈值 α,β,γ\alpha,\beta,\gamma 截断为 kw,ki,kok_{w},k_{i},k_{o} ;合并的子空间形成联合基 𝐐L,𝐐R\mathbf{Q}_{L},\mathbf{Q}_{R},其秩 kL,kRk_{L},k_{R} 满足 kw+ki=kLk_{w}+k_{i}=k_{L} 和 kw+ko=kRk_{w}+k_{o}=k_{R}。 (c) 全局排名分配器将排名 kpk_{p} 分配给每个线性层。