论文

眼见为实:标签噪声下鲁棒视觉引导的跨模态即时学习

Seeing is Believing: Robust Vision-Guided Cross-Modal Prompt Learning under Label Noise

模型训练参数高效训练

摘要

即时学习是视觉语言模型的一种参数有效的方法,但其在标签噪声下的鲁棒性研究较少。视觉内容包含更丰富、更可靠的语义信息,在标签噪声下仍然更加稳健。然而,提示本身很容易受到标签噪音的影响。受这种直觉的启发,我们提出了 VisPrompt,这是一种轻量级且强大的视觉引导提示学习框架,适用于噪声标签设置。具体来说,我们利用跨模式注意机制将视觉语义反向注入提示表示中。这使得提示标记能够选择性地聚合与当前样本相关的视觉信息,从而通过将提示学习锚定到稳定的实例级视觉证据并减少噪声监督的影响来提高鲁棒性。为了解决所有样本使用相同的方式注入视觉信息而造成的不稳定,尽管其视觉线索的质量存在差异,我们进一步引入了一种轻量级条件调制机制来自适应控制视觉信息注入的强度,这在文本侧语义先验和图像侧实例证据之间取得了更稳健的平衡。所提出的框架有效地抑制了噪声引起的干扰,减少了及时更新的不稳定性,并减轻了错误标记样本的记忆。 VisPrompt 显着提高了鲁棒性,同时保持预训练的 VLM 主干冻结并仅引入少量额外的可训练参数。在合成和真实世界标签噪声下进行的大量实验表明,VisPrompt 在七个基准数据集上总体上优于现有基线,并实现了更强的鲁棒性。我们的代码可在 https://github.com/gezbww/Vis_Prompt 上公开获取。