论文

一段胜过一千个图像描述:重新思考视觉语言检索的文本监督

A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval

模型训练监督微调与指令调优

摘要

CLIP 和 BLIP 等对比视觉语言模型通常是在短图像图像描述上进行训练的,这限制了它们从详细文本描述中检索图像的能力。虽然 Long-CLIP 等方法通过位置嵌入插值扩展了标记限制,但我们提出一个更简单的问题:训练文本粒度是否单独决定了长文本检索性能?我们提出了对监督的系统研究,范围从单个图像描述到多句子段落,用于对比图像文本检索。使用基于 Qwen2-VL 和 Llama 3.2 Vision 的合成管道,我们为 500K CC3M 图像生成各种图像描述、难负例和质量评分段落。为了隔离文本粒度的影响,我们仅微调 BLIP 文本编码器,同时在 10 种训练配置中保持视觉编码器冻结。我们的段落监督模型在 ShareGPT4V 上与 Long-CLIP-L 相匹配,并且在图像到文本检索的 DOCCI 上优于 Long-CLIP-L 超过 14 个点,而无需进行架构更改。我们进一步表明,段落监督可以有效地使用长标记序列,而仅图像描述训练会降低超过 60 个标记。增加图像描述多样性可以改善短图像描述检索,但回报递减,而段落监督始终有利于长描述基准,而硬负例在纯文本 微调 中被证明是有害的。对 Flickr30k、COCO、ShareGPT4V 和 DOCCI 的评估提供了对文本粒度、检索方向和描述长度之间权衡的全面分析。