论文

DataComp-VLM:改进的视觉语言模型开放数据集

DataComp-VLM: Improved Open Datasets for Vision-Language Models

模型评测基准与评测资源

摘要

构建高性能视觉语言模型 (VLM) 需要仔细管理大规模训练数据集,但社区缺乏评估此类管理策略的系统基准。我们推出了 DataComp for VLM (DCVLM),这是一个以受控数据为中心的实验基准,旨在改进 VLM 训练。作为 DCVLM 的一部分,我们将涵盖四种数据类型(图像描述对、多模态交错文档、纯文本数据和指令调整数据)的 160 个数据集收集到 6T 多模态标记的语料库中。 DCVLM 允许参与者测试 1B-8B 模型和 6.25B-200B 词元预算 的管理策略(过滤、混合、格式化、采样)。然后,根据精心挑选的套件(涵盖 9 个领域的多达 52 个下游基准)对模型进行评估。我们对 DCVLM 进行了广泛的实验,发现数据混合(而不是过滤)是高质量训练数据集的关键:大量指令的混合比大量字幕的混合规模更好,并且增益在更大的范围内扩大。生成的数据集 DCVLM-Baseline 能够在我们的 33 任务核心套件上使用 200B 训练词元训练 8B VLM,准确率达到 63.6%。与最先进的开放 VLM 训练数据集 FineVision 相比,这代表了 +5.4pp 的改进。 DCVLM 和所有附带的工件将在 https://www.datacomp.ai/dcvlm/ 上公开提供。