论文
让 ViT 说话:生成语言-图像 预训练
Let ViT Speak: Generative Language-Image Pre-training
摘要
在本文中,我们提出了 \textbf{Gen}erative \textbf{L}anguage-\textbf{I}mage \textbf{P}re-training (GenLIP),这是专为多模态 大语言模型 (MLLM) 设计的 Vision Transformer (ViTs) 的极简生成预训练框架。为了更好地将视觉编码器与 LLM 的自回归性质结合起来,GenLIP 训练 ViT 使用标准语言建模目标直接从视觉标记预测语言标记,无需对比批量构建或额外的文本解码器。该设计提供了三个关键优势:(1)\textbf{简单性}:单个 Transformer 联合建模视觉和文本标记; (2) \textbf{可扩展性}:它可以根据数据和模型大小有效地扩展; (3) \textbf{性能}:它在不同的多模式基准测试中取得了有竞争力或优越的结果。 GenLIP 在来自 Recap-DataComp-1B 的 8B 样本上进行训练,尽管使用的预训练数据少得多,但仍匹配或超过了强大的基线。在以原始纵横比对多分辨率图像进行持续预训练后,GenLIP 进一步改进了 OCR 和图表理解等细节敏感任务,使其成为 MLLM 中视觉编码器的坚实基础。