论文
ES-VP:能量形动态视觉提示,实现高效模型适应
ES-VP : Energy-Shaped Dynamic Visual Prompting for Efficient Model Adaptation
摘要
视觉提示(VP)已成为一种参数有效的方法,用于使预训练模型适应下游任务。然而,现有方法面临灵活性和效率之间的权衡。一些方法对所有图像应用固定提示,忽略单个图像特征,而另一些方法则引入辅助网络来生成不同的提示。尽管后者可以提高性能,但它也显着增加了参数的使用以及对特定数据集过度拟合的可能性。此外,辅助网络与预训练模型中固有的偏差相结合,限制了可扩展性和泛化性。在本文中,我们提出了能量形状视觉提示(ES-VP),这是一种使用低秩初始化和能量引导动态适应生成图像特定提示的新颖方法,与单提示方法相比,用更少的参数实现了卓越的性能。 ES-VP直接利用预训练模型进行自适应提示生成,既保证了参数效率,又提高了泛化能力。在 15 个数据集的 5 种架构上进行的广泛实验表明,ES-VP 始终优于当前最先进的 (SOTA) 单一和多样化 VP 方法。例如,在四个数据集上使用 CLIP 架构,ES-VP 的准确率平均优于 SOTA 方法 DAM-VP 2.6%,同时使用的 VP 参数减少了 590$\times$,从而为高效和可泛化的模型适应建立了新的基准。