论文
StateSight:视觉语言模型潜在空间状态重建基准
StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models
摘要
视觉语言模型越来越多地用于多模态问答,但它们从单张图像重建潜在空间结构的能力仍难以被单独隔离。宽泛的基准往往把感知、光学字符识别、领域知识、语言先验和推理混在同一评测中。我们提出StateSight,一个程序化生成的基准,涵盖立方体网对面推理、遮挡立方塔计数和4邻接连通分量计数。每个任务族包含300个单图像提示,带有确定性oracle标签和精确匹配评分。OpenAI GPT-5.5(API模型标识符为gpt-5.5)在三个任务上分别取得59.3%、33.3%和28.3%的准确率,而Claude Sonnet 5分别取得53.3%、18.7%和7.3%。所有最终直接运行的格式错误为零。一个30名参与者、60个条目的人类基线在每个任务上都超过两个模型,平均准确率为80.8%、68.8%和64.3%。可见推导分析识别出图像状态重建与推理程序中反复出现的错误。我们还推出StateSight-Steps,一个包含900个图文交错样本和3,600个确定性中间视觉状态的配套数据集。结果表明,格式有效的回答可能掩盖未能恢复可验证视觉推理所需空间结构的失败。
