论文
通过视觉基础模型中的可微分搜索进行特定层的快速融合发现
Layer-Specific Prompt Fusion Discovery via Differentiable Search in Vision Foundation Models
摘要
视觉提示调整已成为一种参数高效的 微调 方法,用于使大规模 Vision Transformer (ViT) 适应下游任务。由于其可学习提示应用于输入和特征空间,因此在 Transformer 层中共同进行注意力之前,最常用的融合图像和提示标记的方案是串联或相加。在本文中,我们旨在研究视觉提示调整中的一个基本但本质的问题:单一融合方案是否倾向于产生更好的结果,以及这是否有利于开发混合融合方案。为此,我们将该任务表述为双层优化问题,并利用可微架构搜索来解决它。在此背景下,可学习的提示及其融合方案被联合优化。为了丰富架构搜索中的搜索空间,除了串联和加法之外,我们还提出了两种额外的融合方案,即仿射变换和交叉注意力。对涵盖 VTAB-1k、FGVC 和 HTA 的 34 个数据集进行的广泛实验显示,与即时调整基线相比,获得了一致的增益。与 VPT-Deep 和最近的变体相比,通过冻结的 ViT 主干,我们的方法提供了有利的精度-延迟-参数权衡。我们的研究结果表明,提示如何与图像标记融合在视觉提示调整中发挥着重要作用,混合融合方式可以更有效地利用 ViT 的层语义,为视觉提示调整研究提供了新的视角。