论文
重新想象视觉提示:激活提示的力量
Visual prompting reimagined: The power of the Activation Prompts
摘要
视觉提示(VP)已成为一种流行的方法,可以重新利用预训练的视觉模型以适应下游任务。与传统模型 微调 技术不同,VP 将通用扰动直接引入到输入数据中,以促进特定于任务的 微调,而不是修改模型参数。然而,VP 和传统的 微调 方法之间存在明显的性能差距,这凸显了理解和推进输入级 VP 以缩小其当前性能差距的理论和实践中尚未探索的领域。为此,我们引入了一个广义概念,称为激活提示(AP),它通过将通用扰动应用于模型中间层内的激活图来扩展输入级 VP 的范围。通过使用 AP 重新审视 VP 问题并将其用作分析工具,我们证明了 VP 在性能和效率方面的内在局限性,揭示了为什么输入级提示与 AP 相比缺乏有效性,后者表现出模型依赖的层偏好。我们表明,AP 与卷积神经网络和视觉 Transformer 中的归一化调整密切相关,尽管每种模型类型都有不同的提示层偏好。我们还通过分析跨层的全局特征从理论上阐明了这种偏好背后的基本原理。通过对 29 个数据集和各种模型架构进行广泛的实验,我们提供了 AP 的全面性能分析,并将其与 VP 和参数高效的 微调 基线进行比较。考虑到时间、参数、内存使用和吞吐量等因素,我们的结果证明了 AP 在准确性和效率方面的优越性。