论文
SIGMA:弥合视觉基础模型适应的结构和分布差距
SIGMA: Bridging Structural and Distributional Gaps for Vision Foundation Model Adaptation
摘要
视觉基础模型 (VFM) 已展现出令人印象深刻的表征能力。然而,通过完整的 微调 使它们适应下游任务会产生过高的计算和存储开销。参数高效的 微调 (PEFT) 已成为一种引人注目的替代方案,旨在以最低的训练成本实现与完整 微调 相同的性能。尽管如此,由于结构和分布上的差距,将 PEFT 应用于 VFM 来进行密集的预测任务仍然具有挑战性。为了弥补这些差距,我们提出了 \textbf{S}cale-\textbf{I}ntegerated \textbf{G}lobal \textbf{M}odulation \textbf{A}dapter (\textbf{SIGMA}),这是一种新颖的轻量级 PEFT 方法,由两个模块组成:尺度自适应融合和语义调制。具体来说,尺度自适应融合模块用于通过增强多粒度视觉信息的提取来弥合结构间隙。此外,SIGMA在融合特征上引入语义调制来进行全局特征对齐,以进一步消除分布差距。这种设计有利于统一的空间和分布适应,相对于 VFM 主干网,仅需要 1.72% 的可训练参数。跨各种下游密集任务和多个 VFM 主干的综合实验表明,SIGMA 比最先进的 PEFT 方法实现了一致且卓越的性能。