论文

视觉语言模型中转换感知即时条件反射的重新校准对比损失

Re-calibrated Contrastive Loss for Transformation-Aware Prompt Conditioning in Vision-Language Models

模型训练监督微调与指令调优

摘要

确保视觉语言模型的有效迁移学习而不影响其泛化性能至关重要。然而,许多现有方法忽视了数据特征,只是简单地重复使用预训练期间采用的训练策略。具体来说,他们将同类样本视为不同的实例,并独立于配对的文本提示来转换图像,这使得模型学习变得更加困难。我们通过变换感知的即时调节和重新校准的对比损失来解决这些限制。固定文本描述符可识别应用于配对图像的转换,从而在不改变类语义的情况下提供转换级别的一致性。这种设计在转换级别对齐图像和文本分支,实现更丰富的表示,同时保留模型的泛化能力。此外,当每个锚点具有多个有效正值时,我们的损失函数可以减轻软目标交叉熵中的正梯度稀释。在迁移过程中,我们的方法将同类样本视为正例而不是不同的实例,从而使模型能够更有效地学习特定于领域的特征。分布转移、迁移学习和小样本设置的实验证明了对现有方法的持续改进。我们方法的源代码可在 https://github.com/SoongE/ReCalCon 获取。