论文

FLAT:将图像和文本重新采样为一维灵活长度对齐的跨模态词元以进行检索和生成

FLAT: Resampling Image and Text into 1D Flexible-Length Aligned Transmodal Tokens for Retrieval and Generation

模型训练预训练

摘要

传统的多模态表示学习和生成分为两个阶段:首先训练对比或自监督视觉编码器,然后是单独的下游生成模型。这种设置限制了冻结嵌入背后的生成性能。为了弥补这一差距,我们重新审视联合多模态表示学习和生成,以生成可直接由生成解码器使用的线性可插值嵌入。我们提出了 FLAT(灵活长度对齐跨模态表示),这是一种表示预训练框架,可与下游文本到图像 (T2I) 和图像到文本 (I2T) 解码器联合优化共享多模态编码器。通过将对比对齐与双向跨模态生成目标相结合,FLAT 确保其表示既可以作为判别性语义描述符,又可以作为生成条件。在架构上,FLAT 将视觉和文本输入映射到统一的连续一维序列空间,在前缀 K 标记上应用嵌套 dropout 以实现动态输出长度。单个预训练阶段允许 FLAT 跨变量前缀 K 执行跨模态检索和生成,实现 T2I GenEval 分数 71.1。针对特定任务的微调使模型性能与最先进的基线保持一致:T2I 生成的 83.1 GenEval; MS-COCO 图像字幕上的 40.5 BLEU-4 和 138.6 CIDEr; Recall@5 在 MS-COCO 上的得分为 86.8 (I2T) / 75.8 (T2I),在 Flickr30K 上的得分为 98.3 (I2T) / 93.6 (T2I)。最后,定性评估表明 FLAT 表示本身支持线性插值、潜在空间算术和零样本组合检索。