论文

从推理到适应:视觉语言模型的统一最优传输视图

From Inference to Adaptation: A Unified Optimal Transport View of Vision Language Model

模型训练监督微调与指令调优

摘要

视觉语言模型 (VLM) 已展现出卓越的零样本能力,但在推理过程中仍对现实世界的分布变化保持敏感。尽管在测试时调整 VLM 付出了巨大的努力,但它们严重依赖于在推理过程中直接从原始嵌入相似性预测的噪声伪标签,这些伪标签在分布偏移下不可靠,并且会误导调整。为了避免噪声放大,现有的工作在适应过程中制定了粗粒度的代理目标,这无法明确地建模不同模态之间的样本级关系,从而造成目标与推理的不匹配,从而导致边际性能提高。在这项工作中,我们的目标是弥合 VLM 的推理和适应的独立目标,并提出一种称为 \algname 的有原则的 VLM TTA 方法。对于 VLM 推理,我们将零样本图像分类任务制定为通过 Wasserstein OT 公式编码的跨模态对齐问题,在样本级别提供强大的伪标签以有效地适应 VLM。对于VLM适应,我们采用软标签InfoNCE损失来适应基于OT引起的伪标签的VLM,利用细粒度监督通过对比学习显式地建模各个图像-文本对的关系,从而能够在相同粒度下进行准确的推理。此外,我们从理论上揭示,InfoNCE 损失可以巧妙地重新表述为 Wasserstein OT 表述,从而统一 VLM 的推理和适应目标,以实现互惠互利。大量的实验证明了我们的方法的有效性和效率,其性能比最好的方法高出 7%,并且具有最先进的效率。