论文
图像描述优先于视觉问答:推动多模态扩展的是知识密度,而不是任务格式
Caption First, VQA Second: Knowledge Density, Not Task Format, Drives Multimodal Scaling
摘要
多模态 大语言模型 (MLLM) 取得了快速进展,但与纯文本 LLM 相比,它们的缩放行为仍然不太清晰,而且通常更难以预测。增加模型大小和任务多样性通常会产生收益递减。在这项工作中,我们认为多模态扩展的主要瓶颈不是任务格式,而是训练数据中的知识密度。我们首先表明,诸如视觉问答(VQA)之类的特定任务监督除了图像说明之外几乎没有贡献增量语义信息:可以从说明中重建 VQA 信号,而性能损失可以忽略不计。然后,我们证明,通过结构化图像描述丰富和跨模式知识注入,增加知识密度可以带来跨多模态和下游基准的一致性能改进。在受控实验中,性能与语义覆盖的相关性比与任务多样性的相关性更强。这些发现表明,当前的 MLLM 无法扩展主要是因为训练数据缺乏足够的知识覆盖范围。我们提倡以知识为中心的多模态训练,作为可扩展的多模态模型的原则基础。