论文
使用有限数据学习细粒度多模态对齐的相对表示
Learning Relative Representations for Fine-Grained Multimodal Alignment with Limited Data
摘要
多模态预训练有较强泛化能力,但配对数据稀缺时往往不现实。事后多模态对齐可用少量配对样本对齐分别预训练的单模态编码器,但现有方法主要对齐全局表示,忽略图像块与文本词元关系,可能影响需要细粒度跨模态匹配的任务。论文提出以相对表示学习词元级跨模态结构:图像和文本由各自词元与模态空间中一组可学习锚点的相似性表示,训练锚点使匹配样本形成一致的跨模态相似性模式。方法仅学习锚点,无需复杂投影层,却在零样本分类、跨模态检索与零样本分割上持续显著优于现有方法,表明有限配对数据下细粒度结构对事后对齐的重要性。