论文

20/20 视觉语言模型:仅通过数据管理获得更好的 VLM 的处方

20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone

模型训练合成数据

摘要

数据管理已经改变了语言模型和对比图像文本预训练的质量计算前沿,但其在视觉语言模型 (VLM) 中的作用还远未确定。我们询问仅数据管理可以在多大程度上提高 VLM 性能、保持架构、训练配方以及仅计算固定和变化的训练数据。我们的管道应用于 MAmmoTH-VL 单图像子集,在 20 个公共 VLM 基准(涵盖视觉定位、VQA、OCR/文档、字幕、空间/3D、计数、图表、数学、品牌 ID 和多图像推理)中平均将性能提升了 +11.7pp,在我们的高保真 VLM 评估套件 DatBench 的所有九个功能轴上平均提升了 +11.3pp。在 2B 时,我们精心设计的模型比 InternVL3.5-2B 多了 9.9pp,训练计算量减少了约 17 倍,并且仅从预训练来看,就将计算量减少了约 87 倍,与 Qwen3-VL-2B 的差距缩小到了 1.8pp 以内。除了准确性之外,管理还提供了四个进一步的特性:(1)可靠性:训练种子的每项能力标准下降了约 67%,并且提升能在 4k 到 16k 上下文长度的扫描中幸存下来; (2) OOD泛化:9个评估的OOD平均值上升了+7.2pp,尽管仅进行单图像训练,多图像BLINK仍上升了+3.09pp,视觉对应上升了+11.8pp; (3) 超越基准的行为收益:在约 1,100 个开放式查询中,策划的 2B 比匹配计算基线更诚实、更具体,并且比前沿 2B 参考更简洁、更不易被拒绝; (4) 推理成本的帕累托优势:在每个尺度(1B、2B、4B),与匹配计算基线相比,策划的模型都提高了准确性,同时降低了响应 FLOP,并且策划的 4B 与近前沿精度匹配,响应 FLOP 比 Qwen3-VL-4B 低 3.3 倍。数据管理是一种高杠杆工具,可用于构建更好的 VLM,以最多约 150 倍的训练计算量达到近前沿精度。