论文

构图,而不是对话:VLM 失去了场景,而不是线索

Composition, Not Conversation: VLMs Lose the Scene, Not the Thread

模型评测模型能力评测

摘要

视觉语言模型 (VLM) 越来越多地对随着时间的推移裁剪、分割、检索或显示的视觉证据进行推理。然而,大多数 VQA 基准测试都会同时呈现完整的图像和问题。我们要问的是,当相同的信息分散时,模型会丢失什么。我们引入了 Layered-VQA,有 93 个场景和 300 个问题。每个图像都被分解为有序的 RGBA 层,这些层精确地重构了原始场景,并且每个问题都用支持层、最小充分层和干扰层进行了注释。我们评估了 11 个从 3B 到 32B 参数的开放权重 VLM 和两个专有模型,规模为 187,200 个对话,并通过 174 万个开放模型交叉判断进行评分。我们发现了三个一致的失败。构图损失:对问题进行碎片化影响很小,但对场景进行碎片化会大大降低准确性;重新组合相同的层可以很大程度上恢复性能。理想证据反转:即使是预言机选择的足够证据也可能比完整场景表现更差。grounding能力下降:随着需要更多证据,基础能力的下降速度比答案准确性要快得多。总之,这些结果表明,仅有正确的视觉证据是不够的。证据的组合和呈现方式决定了模型是否可以使用和支撑它。正确的证据还不够:VLM 需要它来自的场景。