论文

GroundBench:用于定位 VLM 可供性失败的分解反事实基准

GroundBench: A Factorized, Counterfactual Benchmark for Locating VLM Affordance Failures

模型评测基准与评测资源

摘要

一项配套评估发现,在操作提示中命名目标部件可将 8 个视觉语言模型的动作准确性提高 0.32-0.63,在部件被命名之前,没有任何模型的性能优于恒定基线。然而,为部件命名提供了真实系统必须推断的信息,从而混淆了视觉基础、机械推理和类别与动作关联。我们引入了 GroundBench,这是一个诊断基准,它通过六个分支合并条件将这些解释分开,每个条件添加一个受控信息束,以及针对同一图像中可见的真实替代部分的反事实重新询问。在三个 OpenAI 模型和 1,068 个预测中,提供没有其身份的目标区域会使动作准确度等于或低于 0.53 多数基线(0.26、0.26 和 0.53),尽管模型很大程度上再现了提供的区域。提供不带位置的身份会产生 0.74、0.68 和 0.68。此策划集中的每个高于基线的收益都发生在所提供的零件类别本身决定操作的情况下。无视力对照使 GPT-5 的分数保持不变或有所提高,提供了与实质性类别与行动关联一致的证据。 GPT-4o mini 在一个条件下会下降,因此这种解释并不通用。添加关节类型和运动轴不会提高六个模型层比较的准确性。在来自 32 个对象的 74 个反事实对上,GPT-5 实现了 0.86 对加权合规性和 0.07 的捷径率,但未能满足所有观察到的推举垂直案例。 GroundBench 识别哪些提供的信息改变了可供性行为,并测试是否可以通过文本快捷方式再现明显的视觉定位性能。