论文

视觉语言模型的中性参考提示

Neutral-Reference Prompting for Vision-Language Models

上下文与知识上下文工程

摘要

视觉语言模型 (VLM) 的高效迁移学习通常会受到新基础权衡 (BNT) 的影响:提高未见过的(新)类的性能通常会降低已知(基础)类的准确性。解决如何在不牺牲已知类别性能的情况下提高对未知类别的识别仍然是一个核心挑战。现有的工作经常简单地将 BNT 归因于对已知类的过度拟合。我们观察到一个有趣的现象:VLM 经常对某些下游数据表现出不对称混淆,即 A 类样本被系统性地错误预测为 B 类,而反向混淆(B 到 A)很少发生。对于已知的类别,可以通过使用交叉熵损失进行调整来减轻这种偏差,但对于未知的类别,这种预训练引起的偏差仍然存在并损害泛化。受此启发,我们提出了 NeRP,一种即插即用的提示校正策略,可以在不修改模型参数的情况下改善对未见类别的区分。 NeRP 利用中性文本提示和参考图像来沿着预先训练的类间几何形状测量类的先验偏好,并将它们与样本可能性相结合以获得模型的替代分数。如果对于给定的样本,先验强烈支持当前的预测,而观察到的证据明显不足,我们会在容易混淆的类对之间进行局部翻转,从而纠正先验主导的错误预测。跨多个主干网和 15 个小样本和跨域基准的广泛实验表明,NeRP 显着提高了未见类的准确性,同时保留了已知类的预测性能。