论文

BareBones:VLM 中零样本几何理解的基准测试

BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs

模型评测基准与评测资源

摘要

虽然视觉语言模型 (VLM) 在各种多模态任务中展示了卓越的零样本识别能力,但这些架构是否真正理解几何结构,还是仅仅利用 RGB 纹理和上下文先验作为统计捷径,仍然是一个悬而未决的问题。现有的评估无法隔离这种机制,将语义推理与纹理映射混为一谈,并依赖不精确的注释,从而无意中泄漏环境线索。为了解决这一差距,我们引入了 $\textbf{BareBones}$,这是一个零样本基准测试,旨在对纯几何形状理解进行压力测试。我们在六个数据集中整理了几何上不同类别的像素级轮廓:五个已建立的分割源(ImageNet-S、DIS5K、ThinObject5K、PASCAL VOC、CUB-200)和我们新颖的旗舰集合 WTP-Bench,建立了无噪声的几何分类法。 WTP-Bench 是一种极端的、细粒度的视觉难题,它迫使模型仅从边界轮廓中识别类间几何概念。我们对 26 个最先进的专有和开放权重 VLM(例如 GPT-4.1、Gemini、Claude Sonnet 4.5、LLaVA)的评估揭示了 RGB 剥夺下一致、严重的性能崩溃,我们将这种现象称为 $\textit{Texture Bias Cliff}$。通过记录通用的结构盲点,BareBones 为真正的几何基础建立了严格的标准。项目页面:https://eternal-f1ame.github.io/WTP-Bench/