论文
DiscoVL:通过视觉语言模型的正交对抗正则化揭示解缠结的跨模态表示学习
DiscoVL: Unveiling Disentangled C ross-Modal Representation Learning via Orthogonal Adversarial Regularization for V ision-Language Models
摘要
预先训练的视觉语言模型在各种感知任务中表现出色,但在不牺牲泛化性的情况下使其适应新的下游环境仍然很重要。现有的参数有效的提示学习方法通常会产生不一致的表示,并且无法考虑语义分布的变化。在这项工作中,我们提出了 DiscoVL,一种解开的跨模态表示学习框架,它将正交对抗正则化与视觉语言模型的结构化跨模态对齐结合起来。为了解决跨模态交互不足的问题,我们的 DiscoVL 设计了一种多分支低秩残差对齐器,它将表示分解为子空间,并在每一层的视觉和文本流之间实现双向跨模态反馈。此外,虽然传统的三元组约束过度拟合类质心的特征,但我们为对抗性三元组损失设计了正交正则化,这可以防止质心崩溃并大大提高泛化能力。对 15 个基准的评估表明 DiscoVL 提供 与最先进的方法相一致的改进,用于从基础到新颖的泛化、跨数据集评估和小样本学习