论文

PlanBench-V:视觉语言模型的空间规划地图基准

PlanBench-V: A Spatial Planning Map Benchmark for Vision-Language Models

模型评测基准与评测资源

摘要

空间规划地图是领土治理的核心,它将规划目标、法规和空间策略转化为决策、公共沟通和机构协调的视觉形式。然而,它们的解释需要细粒度的视觉感知、空间推理和基于政策的专业判断,这给人类学习者和人工智能系统带来了重大挑战。随着视觉语言模型(VLM)的快速发展,其在城市规划分析中的应用越来越受到关注,但现有的多模态基准主要针对一般视觉理解,而忽视了规划实践中特定领域的认知过程。为了解决这一差距,我们引入了 PlanBench-V,这是第一个用于评估空间规划地图解释中的 VLM 的综合基准。我们首先构建了空间规划地图数据库 (SPMD),这是一个由专业规划人员整理的 223 张规划地图和 1629 个问答对的专家注释数据集,涵盖不同的地理区域和制图风格。然后,我们提出了一个基于理论的评估框架,评估四种渐进能力:感知、推理、关联和实施,对应于规划地图解释的认知管道。两代 VLM 的广泛实验显示出明显的进步,但仍然存在局限性。 2026 年最佳代理推理模型 Qwen3.6-Plus 的性能大幅优于 2025 年最佳模型 GPT-4o 27%。然而,所有模型仍然难以应对需要评估判断、政策敏感性和约束意识决策的以实施为导向的任务。这些发现揭示了当前 VLM 在专业规划环境中的基本局限性,并强调了对领域自适应多模态推理框架的需求。代码和数据可在 https://plangpt.github.io 获取。