论文
SpaceCast-Bench:评估视觉语言模型中的预测空间推理
SpaceCast-Bench: Evaluating Predictive Spatial Reasoning in Vision-Language Models
摘要
现有的空间推理基准主要测试空间感知:读出输入中已经可见的关系。然而,现实世界的空间智能需要预测性空间推理:根据观察构建场景,预测干预措施如何改变它,并对看不见的结果进行推理。我们推出了 SpaceCast-Bench,这是第一个直接诊断性评估此功能的基准。围绕观察-转换-推断框架构建,来自 182 个现实世界场景的 3,862 个问题跨越三个级别的 16 种任务类型:静态感知、局部预测和全局预测,逐步要求场景理解、空间状态更新以及对未观察结果的关系推理。评估 21 个模型暴露出明显的差距:最强的模型仅达到 58.0%,而人类的表现为 87.2%,而空间专业模型仍然接近随机机会。受控分析进一步表明,桥梁视图对于整合分布式观测至关重要,并且明确的 3D 证据比模型更可靠地受益于模型。 生成的结果图像或视频。对我们以编程方式生成的数据进行微调,将 Qwen3-VL-4B 从 34.0% 提升至 65.7%,六个域外基准的宏观平均增益。