论文

JigShape:通过拼图评估 VLM 中的视觉几何推理

JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles

模型评测基准与评测资源

摘要

拼图游戏需要对视觉内容和几何约束进行联合推理,但现有的基准测试使用矩形切割,在纹理重复区域中创建不明确的 真值。我们引入 \textit{\ours{}},这是一个带有制表符和空白互锁部件的基准,其中几何约束提供了强大的本地兼容性要求,与视觉内容相结合,产生明确的 真值。在四种网格密度(4$\times$4 到 16$\times$16)的 95K 个实例中,我们发现 \textbf{零样本 VLM 很大程度上缺乏几何推理}:五个前沿模型(GPT-5.5)中只有一个超过了 4$\times$4 谜题的随机基线,而所有其他模型都在机会水平上表现。虽然受监督的 微调 在 4$\times$4 上实现了 $>$97\%,但 \textbf{所有模型在更大的网格上崩溃}:GPT-5.5 在 8$\times$8 上从 70\% 下降到接近随机,甚至微调模型在 12$\times$12 上也下降到 5\% 以下。这种“缩放悬崖”表明,随着部件数量的增加,当前的架构无法保持一致的约束满足。 \ours{} 将可扩展的几何推理作为视觉语言模型的公开挑战。