论文

视觉语言模型中看起来的能力限制实际上是读出限制

What Looks Like a Capability Limit in Vision-Language Models Is a Readout Limit

模型评测模型行为与机制分析

摘要

视觉语言模型的基准以某种约定提供了答案选择:字母、颜色名称、像素坐标。该公约被视为中立。我们发现事实并非如此,基准报告的限制可能属于读数而不是模型。在 200 张 COCO 照片上,Qwen3-VL-4B 在以英语给出位置时为命名对象的九个位置中选择正确之一,当位置以英语给出时为 68.5%,当相同位置以像素坐标给出时为 20.0%。几率是11.1%。当答案选项是坐标时,就会产生成本;相反,为模型提供问题中的坐标会花费 3.5 分,而且意义不大。该间隙保持在 4x4 网格上,在 8 位而不是 4 位量化下,并且在每个切片中按对象大小、边界距离和类别进行划分。它还决定哪种模型获胜。两个采用英文名称的模型在一个坐标系中相差 39 个点,在另一个坐标系中相差 54 个点,方向相反。在颜色任务上,能够完成该任务的四个开放模型中的三个显示出惩罚;在照片方面,三个开放模型中的两个可以做到这一点,Gemini 也是如此,在可解析答案上得分为 11.1 分 (p = 1e-4)。 GPT-4o 没有。为了询问模型是否读取坐标,我们为每个坐标附加错误的名称并记录模型遵循的名称。以色相角度书写的颜色选项如下;四次机会遵循标准化像素约定。这区分了模型可以使用的约定和不能使用的约定,尽管它没有预测两个未经尝试的约定的准确性。五个模型还用五种不同的方式命名相同的色轮,因此固定答案词汇在模型之间也不是中立的。在这项工作中,我们五次将一个有能力的模型衡量为无能力,因为我们的评分者和模型对答案的看法存在分歧。我们报告每个案例。它们是这一现象的缩影。