论文

StateSight:视觉语言模型潜在空间状态重建基准

StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models

模型评测基准与评测资源

摘要

视觉语言模型越来越多地用于多模态问答,但它们从单张图像重建潜在空间结构的能力仍难以被单独隔离。宽泛的基准往往把感知、光学字符识别、领域知识、语言先验和推理混在同一评测中。我们提出StateSight,一个程序化生成的基准,涵盖立方体网对面推理、遮挡立方塔计数和4邻接连通分量计数。每个任务族包含300个单图像提示,带有确定性oracle标签和精确匹配评分。OpenAI GPT-5.5(API模型标识符为gpt-5.5)在三个任务上分别取得59.3%、33.3%和28.3%的准确率,而Claude Sonnet 5分别取得53.3%、18.7%和7.3%。所有最终直接运行的格式错误为零。一个30名参与者、60个条目的人类基线在每个任务上都超过两个模型,平均准确率为80.8%、68.8%和64.3%。可见推导分析识别出图像状态重建与推理程序中反复出现的错误。我们还推出StateSight-Steps,一个包含900个图文交错样本和3,600个确定性中间视觉状态的配套数据集。结果表明,格式有效的回答可能掩盖未能恢复可验证视觉推理所需空间结构的失败。

StateSight:视觉语言模型潜在空间状态重建基准:论文配图
图1. StateSight 的三个任务族:立方体网折叠、隐藏立方体占据和连通分量结构。各面板在统一受控渲染风格下分别隔离了平面到三维的面关系、遮挡占据和4邻域拓扑。