论文

显示,而不是讲述:在生成像素而不是 LLM 文本中评估空间认知

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

模型评测基准与评测资源

摘要

空间智能对于智能体从静态语义理解转向与物理世界交互至关重要。许多空间任务都基于连续的视觉场景,其中位置、区域和路径通过指向、标记或绘图来表达比通过报告精确坐标或离散文本符号更自然。然而,现有的空间推理基准通常需要坐标、选项或文本,从而导致图像生成模型的答案界面不匹配。这使得在与文本输出 VLM 相同的任务语义下评估图像生成模型变得困难,尽管它们能够直接在像素空间中外部化空间判断。我们提出了 ProVisE(协议化视觉评估),这是一个与基准无关的框架,它从图像生成模型中得出协议约束的视觉答案,并将其解析为与原始指标兼容的结构化预测。 ProVisE 还包括一个 Agentic 构建器,可以为新基准构建和验证特定于任务的协议。我们进一步介绍 SpatialGen-Bench,这是一个精心策划的诊断基准,包含 14 个空间子任务、四个能力级别和多种答案形式的 470 个样本。我们在统一的环境中评估代表性文本输出 VLM 和图像生成模型,并在六个外部空间基准上验证 Agentic 协议构建。结果表明,当空间答案可以直接在像素空间中外化时,图像生成模型具有竞争力,而文本输出 VLM 在组合空间推理中保留了明显的优势。这些发现揭示了像素空间表达和基于文本的推理的互补优势,并建立了一个用于研究图像生成模型中的空间认知的度量兼容的测试平台。