论文
SAMPLe:基于 SAM 的优化器,用于 VLM 中的快速学习
SAMPLe: SAM-based Optimizer for Prompt Learning in VLMs
摘要
事实证明,像 CLIP 这样的预训练视觉语言模型 (VLM) 作为各种下游应用的基础模型非常有效。然而,VLM 中的提示学习遇到了性能泛化困境:虽然可以调整提示以在可见分布上实现高精度,但这种调整过程通常会破坏它们对未见数据的泛化能力。有限的可学习提示集对输入进行情境化和条件化,以将其引导至预训练的 VLM 中的任务,但往往会过度拟合训练数据,从而导致特定任务性能和保持泛化之间的权衡。为了解决这个困境,我们引入了 SAMPLe(锐度感知最小化提示学习),这是一个插件锐度感知优化器,它通过考虑损失景观锐度来增强提示的泛化性。与传统方法不同,SAMPLe 通过在每一步满足目标函数约束来平衡探索和利用,并根据局部曲率和梯度属性动态适应当前的优化状态。这种方法减少了对已见分布的过度拟合,并提高了对未见数据的适应性,保留了预训练 VLM 模型的泛化潜力。我们将 SAMPLe 集成到多个即时学习框架中,包括 CoOp、CoCoOp、MaPLe、TCP 和 Co-Prompt,证明了其在不同方法中的有效性。实验表明,SAMPLe 提升了即时学习框架,并在不同的设置中始终优于现有优化器,将其自身打造为强大的、与模型无关的即时学习解决方案。