论文

并非所有错误都会产生缩放:视觉语言推理中缩放停止的地方

Not All Error Yields to Scale: Where Scaling Stops in Vision-Language Inference

模型评测模型能力评测

摘要

视觉语言模型 (VLM) 面临着处理更多视觉信息以实现细粒度感知和使用更大的语言主干进行复杂推理之间的固定预算权衡。现有的研究没有告诉我们要部署骨干尺寸和输入分辨率的哪种组合,特别是在高分辨率部署中。为了解决这一差距,我们提出了可分离定律,该定律描述了 VLM 性能如何随语言主干大小和视觉词元计数而变化。我们将该定律与 26 个 InternVL 和 QwenVL 模型(语言主干尺寸从 1B 到 72B)、图像尺寸从 224 像素到 8K 的四个高分辨率基准的测量结果进行拟合。我们发现,响应扩展的问题可以根据它们所需的技能来预测,而相当一部分根本不会响应。我们还发现,这两个模型系列从更大的主干中获得的收益相似,而从更多视觉词元中获得的收益却截然不同。与成本法相结合,可分离法给出了在主干大小和视觉词元之间分配计算的封闭式规则。当部署仅限于可用配置时,法律会确定在相同预算下性能接近最佳可行选择的模型和图像大小。我们希望我们的工作提供一种原则性的方法来决定模型应该被允许以高分辨率看到多少,考虑到它必须推理的内容。