论文
视觉语言模型中标签噪声提示调整的内在梯度抑制
Intrinsic Gradient Suppression for Label-Noise Prompt Tuning in Vision-Language Models
摘要
像 CLIP 这样的对比视觉语言模型表现出了卓越的零样本泛化能力。然而,即时调整仍然对标签噪声高度敏感,因为错误标记的样本会产生不成比例的大梯度,可能会压倒预先训练的先验。我们认为,由于 CLIP 已经提供了接近最优的初始化,因此适应本质上应该是保守的,特别是针对噪声环境中常见的极端梯度更新。为此,我们提出了 Double-Softmax Prompt Tuning (DSPT),一种用于内在梯度抑制的无超参数方法。通过应用顺序概率归一化,DSPT 引入自适应饱和区,抑制高误差噪声样本的梯度,同时保持信息更新。我们还提供了关于该机制如何实现自适应抑制的理论分析和经验证据。该设计将传统上的训练瓶颈“梯度消失”转变为用于标签噪声提示调整的原则性噪声过滤屏蔽。大量实验证实,这种简单的嵌入式设计在各种噪声基准上实现了最先进的稳健性,优于具有复杂架构和手工设计超参数的方法。