论文
用于跨模态相似性表示的变分适配器
Variational Adapter for Cross-modal Similarity Representation
摘要
视觉语言模型的核心在于测量统一表示空间内的跨模态相似性。然而,大多数图像文本匹配或多类图像分类数据集缺乏细粒度的跨模式匹配注释,迫使连续相似性空间进入二元分类边界。这种压缩会导致假阴性样本,并显着损害跨模式任务的泛化性能。虽然先前的研究试图通过对模态内模糊性进行建模来缓解这一问题,但它常常忽略了固有的注释缺陷,导致不确定性分配不理想。为了应对这些挑战,我们提出了一种跨模态相似性表示的变分适配器(VACSR)。这种方法将具有细粒度语义稀缺性的图像文本匹配重新表述为变分推理问题。它为跨模式相似性构建了一个潜在空间,并使用正则化技术来减轻对二进制注释的过度拟合。图文检索、领域泛化和从基础到小说的泛化实验证明了该方法的有效性和鲁棒的泛化能力。