论文
什么从文本转移到视觉? VLM 的能力扩展定律和传输动态
What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs
摘要
在构建视觉语言模型 (VLM) 时,选择正确的 大语言模型 (LLM) 主干是最重要的决定,但它从根本上来说仍然是无原则的:基于计算的缩放法则无法在模型系列之间泛化,并且不存在用于在训练开始之前直接预测 VLM 性能的框架。我们提出了能力驱动的多模态缩放法则,这是第一个跨系列框架,可以根据直接可观察的文本能力来预测 VLM 基准准确性。给定通过 PCA 从 LLM 文本基准中提取的低维能力得分 $S$,我们将 VLM 性能建模为 $S$ 的函数,并使用每主干传输率和量化数据扩展效率的吸收率。为了适应和验证该框架,我们在严格控制的配方下,在涵盖 7 个模型系列的 34 个 LLM 上训练了超过 150 个 VLM。对 200 多个文本和 50 个多模态基准的评估表明,该定律准确地推断出从高达 8B 参数的模型到 72B 规模主干的传输率,以高保真度预测完整的 VLM 训练轨迹,并推广到完全保留的模型系列。除了缩放定律之外,我们的分析还提出了可行的见解:某些文本基准与多模态性能负相关,暴露了潜在的基准博弈行为;由于更高的吸收率和更低的数据缩放衰减,基础 LLM 作为 VLM 主干优于指令调整的对应产品;不同的模型族在转移吸收空间中占据不同的位置。该框架将骨干选择从昂贵的经验扫描转变为有原则的定量决策。代码和数据可在 https://github.com/wangq-dev/CDMScaling 获取。