论文

LoCA:视觉基础模型的空间感知低秩卷积自适应

LoCA: Spatially-Aware Low-Rank Convolutional Adaptation of Vision Foundation Models

模型训练参数高效训练

摘要

预训练的视觉基础模型 (VFM) 为各种下游任务提供强大的视觉表示。 VFM 适应的关键挑战源于完整 微调 的高昂成本和灾难性遗忘。为了解决这个问题,低秩适应 (LoRA) 已成为参数高效 微调 (PEFT) 的流行范例。然而,LoRA 通常是为由 2D 矩阵参数化的 Transformer 自注意力层而设计的。由于卷积核本质上耦合 4D 张量内的空间和通道信息,因此将它们强制转换为整体 2D 矩阵会破坏固有的空间拓扑。在本文中,我们提出了低秩卷积适应(LoCA),这是一种卷积感知的 PEFT 框架,通过解耦通道和空间适应来解决空间通道纠缠。 LoCA 引入了用于密集跨通道混合的低秩通道自适应,并通过奇异值分解 (SVD) 细化从预训练内核中提取的空间基础。实验结果表明,LoCA 保留了预先训练的空间先验,并在细粒度分类、领域广义语义分割和生成基准方面实现了有竞争力或最先进的性能。