论文

混凝土丛林:走向具体性为构图理解铺平了对比负面挖掘

Concrete Jungle: Towards Concreteness Paved Contrastive Negative Mining for Compositional Understanding

模型训练预训练

摘要

视觉语言模型展示了卓越的功能,但经常难以进行组合推理,在词序和属性绑定方面表现出漏洞。这种限制是由于在对比预训练期间区分细微语义变化所需的信息样本的稀缺造成的。尽管硬负挖掘提供了一种有希望的补救措施,但现有方法缺乏明确的机制来指示哪些语言元素进行修改。这项研究不是设计生成架构,而是将词汇具体性确立为负样本功效的基本决定因素。修改高度具体的术语会产生更明显的结构和视觉差异,从而提供更强的学习信号。利用这一原理,ConcretePlant 被提出来系统地隔离和操纵基于感知的概念。 InfoNCE 的分析进一步揭示了严重的梯度不平衡,其中容易区分的对不成比例地压垮了优化过程,并限制了可用于细微学习的带宽。为了解决这种退化问题,采用基于间隔的方法来制定Cement损失。通过将心理语言学分数与​​样本难度相关联,该目标动态校准应用于个体训练对的惩罚。综合评估证实了这些理论主张。该集成框架被称为 Slipform,在不同的成分评估基准、一般跨模态检索、单标签和多标签线性探测中实现了最先进的准确性。